Benchmarking Foundation Models for Time Series Classification
A unified benchmark spanning 198 unique time series classification datasets, four evaluation tracks, and comparable dataset-level reporting.
Total
198
Univariate
128
Multivariate
70
Tracks
4
198 unique datasets
Overall Leaderboard Preview
Ranked by mean accuracy with equal weighting across 198 unique datasets.
1 | GDUT · Huawei Noah’s Ark Lab · Université Paris Cité · MBZUAI · Shantou University | 78.56 |
2 | Huawei Noah’s Ark Lab · Université Paris Cité | 77.73 |
3 | SCUT · A*STAR · Khalifa University | 76.87 |
4 | Huawei Noah’s Ark Lab · Université Paris Cité | 76.62 |
5 | Auton Lab, Carnegie Mellon University | 76.23 |
Dataset profile
Benchmark Composition
A high-level view of the benchmark without publishing individual dataset or suite identities.
Total
198
Univariate
128
Multivariate
70
Tracks
4
Protocol
Evaluation Tracks
Results remain separated by adaptation setting so each score has a clear scientific meaning.
01Standard
Full official training splits with dataset-level equal weighting.
02Low-shot
Matched label budgets across methods and feasible datasets.
03Training-Free / ICL
Predictions without target-specific parameter updates.
04Frozen-Probe
Frozen representations with a standardized lightweight probe.