中文

基于偏好自适应强化学习的人口少数群体满意度估计

计算与语言 2025-11-10 v1

摘要

对话系统中的用户满意度本质上是主观的。当同一响应策略被应用于不同用户时,由于个体意图和偏好差异,人口少数群体用户可能会给出与多数群体用户不同的满意度评分。然而,现有的对齐方法通常训练一种通用型模型,旨在实现广泛共识,常常忽视人口少数群体的视角和用户的特定化适应。我们提出了一个统一框架,用于建模个体和群体层面的偏好,以实现用户满意度估计。首先,我们引入链式个性化推理(Chain-of-Personalized-Reasoning, CoPeR),通过可解释的推理链捕获个体偏好。其次,我们提出了基于期望最大化的人口少数-多数偏好感知聚类算法(Majority-Minority Preference-Aware Clustering, M2PC),以无监督方式发现用户的不同群组,从而学习群体层面的偏好。最后,我们将这些组件集成到偏好自适应强化学习框架(PAda-PPO)中,联合优化与个体和群体偏好的对齐。在情感支持对话数据集上的实验表明,用户满意度估计均取得了一致的改进,尤其是针对边缘化用户群体。

关键词

引用

@article{arxiv.2511.05407,
  title  = {Minority-Aware Satisfaction Estimation in Dialogue Systems via Preference-Adaptive Reinforcement Learning},
  author = {Yahui Fu and Zi Haur Pang and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2511.05407},
  year   = {2025}
}

备注

IJCNLP-AACL 2025 (Main)