LENS:通过将多模态传感与语言模型对齐以实现面向心理健康的 LLM 叙事合成
计算与语言
2026-05-12 v2 人工智能
摘要
多模态健康传感为评估心理健康提供了丰富的行为信号,然而将这些数值型时间序列测量结果转化为自然语言仍具挑战。当前的 LLM 无法原生处理长时间跨度的传感器数据流,且配对的传感器-文本数据集十分稀缺。为应对这些挑战,我们引入了 LENS,这是一个将多模态传感数据与语言模型对齐以生成具有临床依据的心理健康叙事的框架。LENS 首先将与抑郁和焦虑症状相关的生态瞬时评估(EMA)响应转化为自然语言描述,构建了一个大规模数据集,从 258 名参与者中产生了超过 100,000 个传感器-文本 QA 对。为了实现原生的时间序列整合,我们训练了一个 patch 级编码器,将原始传感器信号直接投影到 LLM 的表示空间中。我们的结果表明,LENS 在标准 NLP 指标和症状严重程度准确性的特定任务度量上均优于强基线。一项由 13 名心理健康专业人士参与的进一步用户研究表明,LENS 生成的叙事全面且具有临床意义。最终,我们的方法推进了 LLM 作为健康传感接口的应用,为能够对原始行为信号进行推理并支持下游临床决策的模型提供了一条可扩展的路径。
引用
@article{arxiv.2512.23025,
title = {LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models},
author = {Wenxuan Xu and Arvind Pillai and Subigya Nepal and Amanda C Collins and Daniel M Mackin and Michael V Heinz and Tess Z Griffin and Nicholas C Jacobson and Andrew Campbell},
journal= {arXiv preprint arXiv:2512.23025},
year = {2026}
}
备注
Camera-ready version. Additional experiments