大型语言模型能否充分进行时间序列上的符号推理?
人工智能
2026-04-27 v4
摘要
从时间序列数据中发现隐藏的符号规律,这一目标始终是伽利略 发现行星运动规律的背景,始终是科学发现与人工智能领域的核心挑战。尽管大型语言模型在结构化推理任务中显示出前景,但其从时间序列数据中推断出可解释、与上下文相匹配的符号结构的能力仍未得到充分探索。为系统评估这一能力,我们引入了 SymbolBench,这是一个全面的基准,旨在评估时间序列上的符号推理能力,涵盖三个任务:多变量符号回归、布尔网络推断和因果发现。与以往仅限于简单代数方程的工作不同,SymbolBench 涵盖了具有不同复杂度的多样化符号形式。我们进一步提出了一个统一框架,将 LLMs 与遗传编程集成,形成一个闭环的符号推理系统,其中 LLMs 既充当预测器又充当评估器。我们的实证结果揭示了当前模型的关键优势与局限,突显了结合领域知识、上下文对齐和推理结构的重要性,以提高 LLMs 在自动化科学发现中的表现。https://github.com/nuuuh/SymbolBench
引用
@article{arxiv.2508.03963,
title = {Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?},
author = {Zewen Liu and Juntong Ni and Xianfeng Tang and Max S. Y. Lau and Qi He and Wenpeng Yin and Wei Jin},
journal= {arXiv preprint arXiv:2508.03963},
year = {2026}
}
备注
camera_ready