中文

LLM 目标化表现不均对脆弱用户的影响成比例

计算与语言 2025-11-07 v2 人工智能 机器学习

摘要

尽管最新型大语言模型(LLM)在许多任务上展现了卓越的性能,但关于模型不良行为(如幻觉和偏见)的研究仍然广泛进行。本文我们研究了LLM响应质量随用户特征变化情况,包括三个维度:英语熟练程度、教育水平和国籍。我们针对事实性和真实性任务,对三种最新型LLM进行了大规模实验,并使用两个不同的数据集进行测试。我们的发现表明,最新型LLM中的不良行为在英语水平较低、教育程度较低、来自美国境外的用户身上发生的频率显著高于其他用户,这使得这些模型对于最容易受到忽视的用户群体而言,成为不可靠的信息来源。

关键词

引用

@article{arxiv.2406.17737,
  title  = {LLM Targeted Underperformance Disproportionately Impacts Vulnerable Users},
  author = {Elinor Poole-Dayan and Deb Roy and Jad Kabbara},
  journal= {arXiv preprint arXiv:2406.17737},
  year   = {2025}
}

备注

Paper accepted at AAAI 2026