LLM 目标化表现不均对脆弱用户的影响成比例
计算与语言
2025-11-07 v2 人工智能
机器学习
摘要
尽管最新型大语言模型(LLM)在许多任务上展现了卓越的性能,但关于模型不良行为(如幻觉和偏见)的研究仍然广泛进行。本文我们研究了LLM响应质量随用户特征变化情况,包括三个维度:英语熟练程度、教育水平和国籍。我们针对事实性和真实性任务,对三种最新型LLM进行了大规模实验,并使用两个不同的数据集进行测试。我们的发现表明,最新型LLM中的不良行为在英语水平较低、教育程度较低、来自美国境外的用户身上发生的频率显著高于其他用户,这使得这些模型对于最容易受到忽视的用户群体而言,成为不可靠的信息来源。
引用
@article{arxiv.2406.17737,
title = {LLM Targeted Underperformance Disproportionately Impacts Vulnerable Users},
author = {Elinor Poole-Dayan and Deb Roy and Jad Kabbara},
journal= {arXiv preprint arXiv:2406.17737},
year = {2025}
}
备注
Paper accepted at AAAI 2026