中文

超越行为主义的表征性伤害:测量与缓解计划

计算机与社会 2024-05-08 v2 人工智能 计算与语言 机器学习

摘要

算法伤害通常被归类为分配性或表征性。本研究特别关注后者,聚焦于检视当前表征性伤害的定义,以辨析其中包含的内容与不包含的内容。此分析促使我们超越行为定义,纳入对认知和情感状态的伤害。该论文概述了高层次的测量要求:确定实施这一方法所必需的专业知识,并通过案例研究加以说明。我们的工作凸显了大型语言模型对实施表征性伤害的独特脆弱性,尤其是当这些伤害未被测量和缓解时。本工作以提出的缓解措施并阐明何时使用它们为结尾。本研究的总体目标是建立一个扩展表征性伤害定义的框架,并将公平性研究的见解转化为实际的测量和缓解实践。

关键词

引用

@article{arxiv.2402.01705,
  title  = {Beyond Behaviorist Representational Harms: A Plan for Measurement and Mitigation},
  author = {Jennifer Chien and David Danks},
  journal= {arXiv preprint arXiv:2402.01705},
  year   = {2024}
}

备注

23 pages, 7 figures