TSC-FM Benchmark

Benchmarking Foundation Models for Time Series Classification

A unified benchmark spanning 198 unique time series classification datasets, four evaluation tracks, and comparable dataset-level reporting.

198 datasets
Univariate
Multivariate
Low-shot
Training-Free / ICL
Frozen-Probe

198 unique datasets

Verified Standard

Overall Leaderboard Preview

Ranked by mean accuracy with equal weighting across 198 unique datasets.

View Full Leaderboard
1

GDUT · Huawei Noah’s Ark Lab · Université Paris Cité · MBZUAI · Shantou University

78.56
2

Huawei Noah’s Ark Lab · Université Paris Cité

77.73
3

SCUT · A*STAR · Khalifa University

76.87
4

Huawei Noah’s Ark Lab · Université Paris Cité

76.62
5

Auton Lab, Carnegie Mellon University

76.23

Dataset profile

Benchmark Composition

A high-level view of the benchmark without publishing individual dataset or suite identities.

Total

198

Univariate

128

Multivariate

70

Tracks

4

Protocol

Evaluation Tracks

Results remain separated by adaptation setting so each score has a clear scientific meaning.

01Standard

Full official training splits with dataset-level equal weighting.

02Low-shot

Matched label budgets across methods and feasible datasets.

03Training-Free / ICL

Predictions without target-specific parameter updates.

04Frozen-Probe

Frozen representations with a standardized lightweight probe.