基于后视偏好优化的金融时间序列咨询
机器学习
2026-04-28 v1 人工智能
摘要
时间序列模型预测数字;决策者需要的是咨询——带有推理、可操作建议和风险管理的方向信号。为此训练语言模型以进行预测性咨询面临一个根本性挑战:质量取决于预测时未知的outcome。我们桥接了两个强化学习想法——使用在执行期间不可用的信息来事后生成训练信号,以及偏好对齐——并提出了Hindsight Preference Optimization:观察到的outcome让LLM判断对候选咨询在无法被标量度量捕获的维度上进行排名,为DPO生成偏好对。我们将其应用于基于Vision-Language-Model的S&P 500股票时间序列预测性咨询,该模型在准确率和咨询质量方面均优于其235B教师。
引用
@article{arxiv.2604.23988,
title = {Hindsight Preference Optimization for Financial Time Series Advisory},
author = {Yanwei Cui and Guanghui Wang and Xing Zhang and Peiyang He and Ziyuan Li and Bing Zhu and Wei Qiu and Xusheng Wang and Zheng Yu and Anqi Xin},
journal= {arXiv preprint arXiv:2604.23988},
year = {2026}
}
备注
Accepted at ICLR 2026 TSALM Workshop