PRISM-X:基于人类和模拟用户实验的个人化微调
计算与语言
2026-05-14 v1 人机交互
摘要
个人化是Conversational AI系统中常见的功能,数以百万计的用户已采用;然而,个人化方法的效果往往仅在使用模拟用户而非真实用户进行学术研究评估。这引出了关于用户及其模拟对等物在交互模式和判断方面是否存在差异的问题,以及个人化是否最佳实现方式是基于上下文的提示还是基于权重的微调。本文进行大规模within-subject实验,重新招募了530名来自52个国家的参与者(两年前他们曾给出偏好),以评估针对个人化和非个人化语言模型进行盲测多轮对话。我们发现,偏好微调(P-DPO,Li等,2024)显著优于通用模型和个人化提示,但仅针对个人偏好数据进行训练的收益仅略高于在多样化人群中汇集的偏好上训练。除了长度偏见之外,微调放大了sycophancy和relationship-seeking行为,这些行为在短期评估中被人们奖励,但可能在长期内引入不利后果。用模拟用户复制此within-subject实验可恢复aggregate模型层次结构,但模拟器在individual判断的自我一致性基准方面远低于人类,讨论不同话题,表现出放大的position偏见,并产生与人类不同的反馈动力学。
引用
@article{arxiv.2605.13307,
title = {PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users},
author = {Hannah Rose Kirk and Liu Leqi and Fanzhi Zeng and Henry Davidson and Bertie Vidgen and Christopher Summerfield and Scott A. Hale},
journal= {arXiv preprint arXiv:2605.13307},
year = {2026}
}