中文

面向个性化心理治疗的多目标对齐语言模型

机器学习 2026-02-20 v1 计算与语言

摘要

精神健康障碍影响全球超过 10 亿人,但由于 workforce 短缺和成本约束,准入仍受限。虽然 AI 系统在治疗领域展现出巨大潜力,但当前的对齐方法会独立优化目标,无法在患者偏好与临床安全之间取得平衡。我们调查了 335 位有心理健康经验者,收集了跨治疗维度的偏好排名,然后开发了一个多目标对齐框架,使用直接偏好优化(DPO)方法。我们为六个准则训练奖励模型:共情、安全、积极倾听、自我激励改变、信任/关系建立以及患者自主性,并系统比较了多目标方法与单目标优化、监督微调和参数合并。多目标 DPO(MODPO)在 empathy(77.6%)和 safety(62.6%)方面优于单目标优化(empathy 93.6%,safety 47.8%),且治疗准则比通用沟通原则高出 17.2%。盲目临床评估确认,MODPO 在一致性上始终被偏好,LLM 评估者的一致性相当于临床医师之间的可靠性。

关键词

引用

@article{arxiv.2602.16053,
  title  = {Multi-Objective Alignment of Language Models for Personalized Psychotherapy},
  author = {Mehrab Beikzadeh and Yasaman Asadollah Salmanpour and Ashima Suvarna and Sriram Sankararaman and Matteo Malgaroli and Majid Sarrafzadeh and Saadia Gabriel},
  journal= {arXiv preprint arXiv:2602.16053},
  year   = {2026}
}