迈向沉思型LLM:一个用于评估和增强心理健康领域LLM对齐的模块化框架
摘要
沉思传统长期以来一直引导着道德行为和亲社会互动,最近的研究表明,沉思原则(例如,正念、慈悲、非二元推理)可能为对齐大语言模型(LLM)提供一种有前景的范式,改善LLM输出中的合作并减少道德违规。然而,随着新模型、评估指标和基准的快速出现,系统地评估沉思原则是否以及如何在多样化和不断发展的场景中增强LLM对齐仍然具有挑战性,现有方法通常是临时的,难以泛化。我们提出了一个模块化、可扩展的评估框架,最初针对心理健康领域,通过可复用的流程实现新模型、指标和基准的无缝集成。该框架目前能复现现有最先进的结果,并通过灵活混合和匹配模型、指标和基准来支持系统的交叉评估,从而实现公平比较和更深入的洞察。其即插即用的提示模块为纳入沉思原则等伦理视角提供了一条原则性途径,允许领域专家无需技术专长即可定义对齐标准。尽管最初专注于心理健康,但该框架与领域无关,可自然扩展到决策、道德推理和人机协作等领域。通过弥合计算评估与以人为中心的伦理推理之间的差距,这项工作为跨越认知科学、行为经济学、哲学和系统设计的跨学科研究奠定了基础,朝着稳健、可信赖和有益社会的人机生态系统迈进。
引用
@article{arxiv.2607.10871,
title = {Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health},
author = {Asher Sprigler and Yang-Yang Feng and Iftach Amir and Jonathan E. Bogard and Todd S Braver and Yi Ding and David Kinney and Yixue Zhao},
journal= {arXiv preprint arXiv:2607.10871},
year = {2026}
}
备注
Accepted as an oral presentation at HARMONY 2026 (Human-centered AI Research for Mental Health, an Open Networking Symposium), co-located with IEEE/ACM Conference on Connected Health: Applications, Systems, and Engineering Technologies (CHASE 2026) held in Pittsburgh, August 6, 2026