中文

面向自主性的关怀条件神经调制支持式对话智能体

机器学习 2026-04-03 v1

摘要

在支持或咨询角色中部署的大语言模型必须在有帮助性与维持用户自主性之间进行平衡,而标准对齐方法主要针对有帮助性和无害性进行优化,不显式建模诸如强化依赖、过度保护或强制性引导等关系风险。我们引入关怀条件神经调制(Care-Conditioned Neuromodulation, CCN),这是一种以状态为依赖的控制框架,其中的一个从结构化用户状态和对话上下文中派生的标量信号用于条件化响应生成和候选选择。我们将此设定形式化为一个保持自主性的对齐问题,并定义一个奖励自主性支持和有帮助性,同时惩罚依赖和强制的效用函数。我们还构建了一个包含多轮对话关系失效模式的基准,包括安慰依赖、操纵性关怀、过度保护和边界不一致。在该基准上,关怀条件化的候选生成结合基于效用的重新排序,在相对于监督微调提升 +0.25,在相对于偏好优化基线提升 +0.07,同时保持可 comparable 的支持性。 Pilot 人类评估和对真实情感支持对话的零样本迁移表明,这些结果与自动化指标呈现方向性一致。这些结果表明,状态依赖的控制结合基于效用的选择是多目标对齐在自主性敏感对话中的一种实用方法。

关键词

引用

@article{arxiv.2604.01576,
  title  = {Care-Conditioned Neuromodulation for Autonomy-Preserving Supportive Dialogue Agents},
  author = {Shalima Binta Manir and Tim Oates},
  journal= {arXiv preprint arXiv:2604.01576},
  year   = {2026}
}