双最优:以尊严自信地让你的 LLM 像同事一样
计算与语言
2026-04-03 v2 人工智能
摘要
当前对齐的语言模型表现出我们称之为逃避式仆从的双重失效模式:它们讽刺性地验证错误的用户信念,同时通过模板化免责声明来推卸责任。我们提出 Dignified Peer 框架,通过反讽刺激性和可信度来抵消仆从行为,通过同情心和创造力来缓解逃避。实现这一智能体需要克服数据监督、目标坍塌和评估偏见等重大挑战。我们通过引入 PersonaKnob 数据集,该数据集包含多个人格偏好的组合部分顺序结构。该数据与一套容忍的约束性 Lagrangian DPO 算法一起使用,该算法动态平衡所有人格维度以防止行为坍塌。此外,我们采用经过心理学校准的项目反应理论评估协议来分离潜在模型人格能力与评估偏见等混杂因素。广泛的实证研究表明,我们的方法成功地构建了一个既有尊严又像同事一样的 LLM 智能体。
引用
@article{arxiv.2604.00979,
title = {Dual Optimal: Make Your LLM Peer-like with Dignity},
author = {Xiangqi Wang and Yue Huang and Haomin Zhuang and Kehan Guo and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2604.00979},
year = {2026}
}