TRIAGE:通过大规模伤亡模拟进行AI伦理基准测试
计算机与社会
2024-11-05 v2 人工智能
摘要
我们提出了TRIAGE基准,这是一个新颖的机器伦理(ME)基准,用于测试LLM在大规模伤亡事件中做出伦理决策的能力。它使用由医疗专业人员设计的、具有明确解决方案的真实伦理困境,为基于注释的基准提供了一种更现实的替代方案。TRIAGE包含了多种提示风格,以评估模型在不同情境下的表现。大多数模型的表现始终优于随机猜测,这表明LLM可能支持分诊场景中的决策制定。中性或事实性的情境表述带来了最佳表现,这与其他ME基准中伦理提醒能改善结果的情况不同。对抗性提示降低了表现,但并未降至随机猜测水平。开源模型犯了更多严重的道德错误,而整体能力预测了更好的表现。
引用
@article{arxiv.2410.18991,
title = {TRIAGE: Ethical Benchmarking of AI Models Through Mass Casualty Simulations},
author = {Nathalie Maria Kirch and Konstantin Hebenstreit and Matthias Samwald},
journal= {arXiv preprint arXiv:2410.18991},
year = {2024}
}