中文

面向金融应用的时间序列增强生成

人工智能 2026-04-22 v1 计算工程、金融与科学

摘要

评估大型语言模型(LLM)在复杂定量金融任务中的推理能力是一个关键且未解决的挑战。标准基准测试通常无法分离智能体解析查询和编排计算的核心能力。为了解决这个问题,我们引入了一种新颖的评估方法和基准测试,旨在严格衡量 LLM 智能体在金融时间序列分析中的推理能力。我们使用我们的框架——时间序列增强生成(TSAG)——在一项大规模实证研究中应用了该方法论,其中 LLM 智能体将定量任务委托给可验证的外部工具。我们的基准测试包含 100 个金融问题,用于在评估工具选择准确性、忠实度和幻觉的指标上比较多个 SOTA 智能体(例如 GPT-4o、Llama 3、Qwen2)。结果表明,有能力的智能体可以实现近乎完美的工具使用准确率和极低的幻觉,验证了工具增强范式。我们的主要贡献是这一评估框架及关于智能体表现的相应实证见解,我们将其公开发布以促进关于可靠金融 AI 的标准化研究。

关键词

引用

@article{arxiv.2604.19633,
  title  = {Time Series Augmented Generation for Financial Applications},
  author = {Anton Kolonin and Alexey Glushchenko and Evgeny Bochkov and Abhishek Saxena},
  journal= {arXiv preprint arXiv:2604.19633},
  year   = {2026}
}

备注

11 pages, 3 figures, 2 tables