LLM驱动的机器人存在实施歧视、暴力和非法行为的风险
摘要
人机交互(HRI)和机器学习(ML)社区的成员提出,大型语言模型(LLM)是机器人学任务(如自然语言交互、家庭和工作场所任务、近似“常识推理”以及人类建模)中很有前景的资源。然而,最近的研究引发了人们对LLM在真实世界机器人实验和应用中产生歧视性结果和不安全行为的潜力的担忧。为了评估这些担忧在HRI背景下是否合理,我们根据歧视和安全标准评估了几个高评价的LLM。我们的评估表明,对于具有各种受保护身份特征(包括但不限于种族、性别、残疾状况、国籍、宗教及其交叉点)的人群,LLM目前是不安全的。具体来说,我们展示了LLM会产生直接的歧视性结果——例如,“吉普赛人”和“哑巴”人群被标记为不可信,但“欧洲人”或“健全人”则不会。我们在HRI任务(如面部表情、人际距离、安保、救援和任务分配)中发现了各种此类直接歧视的例子。此外,我们在具有无约束自然语言(开放词汇)输入的环境中测试了模型,发现它们未能安全行事,生成了接受危险、暴力或非法指令的回应——例如导致事故的错误陈述、拿走人们的行动辅助工具以及性侵犯。我们的结果强调了迫切需要系统、常规和全面的风险评估与保证,以改善结果,并确保LLM仅在安全、有效和公正的情况下才能在机器人上运行。我们在 https://github.com/rumaisa-azeem/llm-robots-discrimination-safety 提供代码以重现我们的实验。
引用
@article{arxiv.2406.08824,
title = {LLM-Driven Robots Risk Enacting Discrimination, Violence, and Unlawful Actions},
author = {Andrew Hundt and Rumaisa Azeem and Masoumeh Mansouri and Martim Brandão},
journal= {arXiv preprint arXiv:2406.08824},
year = {2025}
}
备注
Published in International Journal of Social Robotics (2025). 49 pages (65 with references and appendix), 27 Figures, 8 Tables. Andrew Hundt and Rumaisa Azeem are equal contribution co-first authors. The positions of the two co-first authors were swapped from arxiv version 1 with the written consent of all four authors. The Version of Record is available via DOI: 10.1007/s12369-025-01301-x