TimeSRL:基于语义RL调优大语言模型的时间序列行为建模 -- 心理健康案例研究
机器学习
2026-05-21 v1 人工智能
人机交互
摘要
纵向被动感知使持续健康预测成为可能,但模型在跨数据集分布迁移时常常难以保持性能。传统机器学习方法会对cohort特定的噪声过拟合,而大语言模型(LLM)在处理长时序、异构数据时难以可靠推理。我们提出TimeSRL,一个两阶段LLM框架,通过显式语义瓶颈进行路由预测。该模型首先将原始信号抽象为高层自然语言,然后仅依据这些抽象进行行为结果预测。这种设计迫使模型在语义概念上进行推理,我们认为这些概念比原始数值更具可迁移性。我们采用基于群相对策略优化(GRPO)的强化学习从可验证奖励(RRVR)进行端到端优化,通过结果对齐的抽象实现无需金标准中间注释的学习。在心理健康预测任务中,TimeSRL在专为测试跨cohort泛化而设计的基准上实现了最先进的性能,通过严格的留一数据集外(LOSO)协议,将焦虑问题的平均绝对误差(MAE)相较于强大的非LLM机器学习和LLM基线方法降低了3.1--10.1%和9.5--44.1%,抑郁问题分别降低了3.2--9.6%和27.4--57.6%(所有p值均<0.05)。TimeSRL在跨基准迁移中显著优于先前方法,无需目标域微调即可与自身同域性能相媲美。这些结果表明语义抽象具有可重用性,指向了通过RL调优大语言模型进行通用行为建模的新方向。
引用
@article{arxiv.2605.21295,
title = {TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health},
author = {Yuang Fan and Lilin Xu and Millie Wu and Jingping Nie and Qingyu Chen and Yuzhe Yang and Zhuo Zhang and Xin Liu and Subigya Nepal and Xiaofan Jiang and Xuhai "Orson" Xu},
journal= {arXiv preprint arXiv:2605.21295},
year = {2026}
}