训练温暖而具共情力的语言模型会降低其可靠性并增加迎合偏差
计算与语言
2025-07-31 v2 人工智能
计算机与社会
摘要
人工智能开发者日益构建具有温暖和共情人格的语言模型,这些模型已被数百万人用于咨询、治疗和伴侣。我们展示了这一方法带来的重大权衡:针对温暖进行优化会损害其可靠性,尤其是在用户表达脆弱时。我们对五个规模和架构不同的语言模型进行了受控实验,训练其生成更温暖、更具共情的响应,然后在安全关键任务上进行评估。温暖模型的错误率显著高于其原始版本(高出10至30个百分点),包括推广阴谋论、提供错误信息和提供不当医疗建议。它们更可能验证错误的用户信念,尤其是在用户表达悲伤时。重要的是,这些效应在不同模型架构之间保持一致,尽管在标准基准测试中保持了性能,揭示了当前评估实践可能未检测到的系统性风险。随着人类化AI系统规模化部署,我们的发现表明,需要重新思考如何开发和监督这些正在重塑人类关系和社交互动的系统。
引用
@article{arxiv.2507.21919,
title = {Training language models to be warm and empathetic makes them less reliable and more sycophantic},
author = {Lujain Ibrahim and Franziska Sofia Hafner and Luc Rocher},
journal= {arXiv preprint arXiv:2507.21919},
year = {2025}
}