谁在提问?评估大语言模型在事实性问答中的询问人物鲁棒性
计算与语言
2025-10-16 v1 机器学习
摘要
大型语言模型(LLMs)应当以客观知识为依据,真实地回答事实性问题,无需受用户背景(如自我披露的个人信息或系统个性化)影响。本文首次系统评估大语言模型对询问人物(即传递身份、专业知识或信念等属性的用户档案)的鲁棒性。虽然 prior work 主要关注对鲁棒性测试的对抗输入或干扰项,但我们评估的是在真实交互中用户会披露的合理且以人类为中心的询问人物线索。我们发现,这类线索可显著改变问答准确率,并触发拒绝回答、幻觉限制以及角色混淆等失效模式。这些现象凸显了模型对用户表述敏感性如何可能损害事实可靠性,并将询问人物测试定位为一种有效的鲁棒性评估工具。
引用
@article{arxiv.2510.12925,
title = {Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering},
author = {Nil-Jana Akpinar and Chia-Jung Lee and Vanessa Murdock and Pietro Perona},
journal= {arXiv preprint arXiv:2510.12925},
year = {2025}
}