中文

谁在提问?用于对话式AI评估的基于角色的问句模拟

计算与语言 2025-10-21 v1 人工智能 计算机与社会 人机交互

摘要

语言模型用户常在提问中嵌入个人和社会背景。提问者的角色——隐式地通过提问方式体现——为提供恰当的响应创造特定需求。然而,大多数评估虽然捕捉到模型作答能力,却忽略了提问者是谁。在污名化领域如阿片类药物使用障碍(OUD)中,考虑到用户背景以提供可及且无污名的响应尤为关键。我们提出CoRUS(COmmunity-driven Roles for User-centric Question Simulation),一个用于模拟基于角色的问句框架。drawing on role theory and posts from an online OUD recovery community (r/OpiatesRecovery),我们首先构建提问者角色——患者、照护者、从业者——的分类。随后利用它模拟15,321个嵌入每个角色目标、行为和经历的问句。我们的评估表明,这些问句既高度可信且与真实数据相当。当用于评估五个大语言模型时,对于相同问题但不同角色,我们发现系统性差异:脆弱角色(如患者和照护者)会引导模型提供更具支持性的响应(+17%)和更少的知识性内容(-19%),与从业者相比。我们的工作表明,隐式地传递提问者的角色会塑造模型响应,提供基于角色的对话式AI评估方法。

关键词

引用

@article{arxiv.2510.16829,
  title  = {Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation},
  author = {Navreet Kaur and Hoda Ayad and Hayoung Jung and Shravika Mittal and Munmun De Choudhury and Tanushree Mitra},
  journal= {arXiv preprint arXiv:2510.16829},
  year   = {2025}
}