中文

基于时间序列解释的LLM评估器

人工智能 2026-04-03 v1 计算与语言

摘要

评估基于时间序列数据生成的自然语言解释的事实正确性仍是开放挑战。尽管现代模型会生成数值信号的文本解释,但现有评估方法受限:参考基于相似性度量和一致性检查模型需要参考解释,而传统时间序列方法仅基于数值值,无法评估自由形式的文本推理。因此,尚无通用方法可直接验证解释是否忠实于底层时间序列数据,而无需预定义参考或任务特定规则。我们研究大型语言模型(LLM)作为时间序列解释的生成器和评估器,在无参考设置下进行研究:给定时间序列、问题和候选解释,评估器基于模式识别、数值准确性和答案忠实性分配三分类正确性标签,从而实现原则化的评分和比较。为支持这一目标,我们构建了一个包含350个时间序列案例的合成基准,覆盖七种查询类型,每个查询类型配有正确、部分正确和错误的解释。我们评估了四项任务:解释生成、相对排序、独立评分和多异常检测。结果显示明显的非对称性:生成高度依赖模式,某些查询类型上表现出系统性失效,Seasonal Drop和Volatility Shift的准确率为0.00至0.12,而Structural Break的准确率为0.94至0.96;而评估更为稳健,即使其自身输出错误,模型也能正确排序和评分解释。这些发现表明了基于数据驱动的LLM评估时间序列解释的可行性,并突显了其在时间序列领域数据驱动推理方面的潜在可靠性。

关键词

引用

@article{arxiv.2604.02118,
  title  = {LLM-as-a-Judge for Time Series Explanations},
  author = {Preetham Sivalingam and Murari Mandal and Saurabh Deshpande and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2604.02118},
  year   = {2026}
}

备注

Under Review