提示下估计 LLM 对时间序列分类的能力
计算与语言
2026-03-13 v2
摘要
基于提示的评估表明,大语言模型(LLM)在时间序列分类方面表现不佳,这引发人们对其是否编码有意义时序结构的疑虑。我们指出,这一结论反映了基于提示的生成方式的局限性,而非模型表征能力的限制,通过直接比较提示输出与对相同内部表征的线性探针。虽然零样本提示的性能接近随机,但线性探针将平均 F1 分数提升至 0.61-0.67,常常匹配或超过专门的时间序列模型。层级分析进一步表明,类别判别性时间序列信息在早期 Transformer 层中出现,并被视觉和多模态输入放大。这些结果共同表明,LLM 内部表征与基于提示的评估所揭示的内容之间存在系统性偏差,导致当前评估低估了其时间序列理解能力。
引用
@article{arxiv.2601.03464,
title = {Prompting Underestimates LLM Capability for Time Series Classification},
author = {Dan Schumacher and Erfan Nourbakhsh and Rocky Slavin and Anthony Rios},
journal= {arXiv preprint arXiv:2601.03464},
year = {2026}
}
备注
8 pages + Appendix and References, 9 figures