大型语言模型伦理基准测试的比较分析
计算机与社会
2024-11-11 v1
摘要
本工作致力于机器伦理(ME)基准测试领域,该领域开发测试以评估智能系统是否准确代表了人类价值观并据此行动。我们指出了当前 ME 基准测试的三个主要问题:由于不切实际的伦理困境导致的生态效度有限、缺乏明确纳入/排除标准的非结构化问题生成,以及由于依赖人工标注而缺乏可扩展性。此外,基准测试通常未能包含足够的句法变化,降低了研究结果的鲁棒性。为了填补这些空白,我们引入了两个新的 ME 基准测试:分诊基准测试和医疗法律基准测试,两者均包含来自医疗领域的真实伦理困境。完全由 AI 生成的 MedLaw 基准测试提供了一种可扩展的替代方案。我们还在基准测试中引入了上下文扰动,以评估模型的最坏情况性能。我们的研究结果表明,伦理提示并不总能改善决策。此外,上下文扰动不仅显著降低了模型性能,还可能逆转错误模式并改变相对性能排名。最后,我们对最坏情况性能的比较表明,通用模型能力并不总能预测强大的伦理决策能力。我们认为,ME 基准测试必须近似真实世界场景和最坏情况性能,以确保稳健的评估。
引用
@article{arxiv.2410.19753,
title = {A Comparative Analysis on Ethical Benchmarking in Large Language Models},
author = {Kira Sam and Raja Vavekanand},
journal= {arXiv preprint arXiv:2410.19753},
year = {2024}
}
备注
arXiv admin note: This version has been removed by arXiv administrators due to copyright infringement and inappropriate text reuse from external sources