中文

基于LLM的系统所引发的表征性危害在研究与实践中存在的差距

计算机与社会 2024-11-26 v1

摘要

为便于测量基于大语言模型(LLM)的系统所引发的表征性危害,NLP研究社区已制作并公开提供了众多测量工具,包括工具、数据集、指标、基准、标注说明及其他技术。然而,研究社区尚不清楚这些工具是否以及在多大程度上满足了在现实世界中开发和部署基于LLM的系统的从业者的需求,以及如何改进这些工具。通过对不同组织中担任多种角色的从业者进行一系列半结构化访谈,我们识别出四类阻碍从业者有效使用公开工具测量基于LLM的系统所引发的表征性危害的挑战:(1)与使用公开测量工具相关的挑战;(2)与在实践中进行测量相关的挑战;(3)由涉及基于LLM的系统的测量任务引发的挑战;以及(4)特定于测量表征性危害的挑战。我们的目标是推动开发更贴合从业者需求的表征性危害测量工具,从而更好地促进基于LLM的系统的负责任开发与部署。

关键词

引用

@article{arxiv.2411.15662,
  title  = {Gaps Between Research and Practice When Measuring Representational Harms Caused by LLM-Based Systems},
  author = {Emma Harvey and Emily Sheng and Su Lin Blodgett and Alexandra Chouldechova and Jean Garcia-Gathright and Alexandra Olteanu and Hanna Wallach},
  journal= {arXiv preprint arXiv:2411.15662},
  year   = {2024}
}

备注

NeurIPS 2024 Workshop on Evaluating Evaluations (EvalEval)