对话:亲爱他们, 讨厌他们, 驾驭他们
计算与语言
2025-11-25 v2
摘要
大语言模型(LLM)在对话流畅性方面取得了不断提升, 但在赋予其细腻、贴近人类的情感表达方面仍面临重大挑战. 当前对齐技术往往仅处理表层输出, 或需要大量微调. 本文展示了针对性激活工程可驾驭 LLaMA 3.1-8B 以展现更贴近人类的情感细微差别. 我们首先采用归因补丁技术识别具有因果影响的组件, 通过观察诊断性对话任务中的激活模式, 找到关键干预位置. 随后, 我们从对比文本对(积极 vs. 消极情感示例)中生成的激活差异中派生情感表达向量. 将这些向量应用于新的对话提示中, 可显著增强情感特征: 被驾驭的响应显示出 increased positive sentiment(如快乐、信任)和更频繁的第一人称代词使用, 这表明更具个人参与感. 我们的发现提供了一种精确且可解释的方法, 用于控制 LLM 中的特定情感属性, 为开发更具对齐性和同情心的对话 AI 贡献了重要作用.
引用
@article{arxiv.2505.17413,
title = {Conversations: Love Them, Hate Them, Steer Them},
author = {Niranjan Chebrolu and Gerard Christopher Yeo and Kokil Jaidka},
journal= {arXiv preprint arXiv:2505.17413},
year = {2025}
}
备注
We have created a new arXiv submission with a more up to date version of this paper at arXiv:2511.12832