中文

不要抹除,要告知!文化遗产馆藏中有害语言的检测与语境化

计算与语言 2025-06-02 v1

摘要

文化遗产(CH)数据蕴含着无价的知识,反映了社会的历史、传统和身份认同,并塑造了我们对过去和现在的理解。然而,许多 CH 馆藏包含反映历史偏见的过时或冒犯性描述。由于任务的庞大规模和复杂性,CH 机构(CHIs)在整理这些数据时面临重大挑战。为了解决这个问题,我们开发了一种 AI 驱动的工具,可以检测 CH 元数据中的冒犯性术语,并为其历史背景和当代认知提供语境化见解。我们利用与边缘化社区、研究人员和 CH 专业人士共同创建的多语言词汇表,结合传统的 NLP 技术和大型语言模型(LLM)。该工具作为独立的 Web 应用程序提供,并与主要的 CH 平台集成,已处理超过 790 万条记录,对其元数据中检测到的争议性术语进行了语境化。我们的方法不是抹除这些术语,而是寻求告知,使偏见可见,并为创建更具包容性和可访问性的 CH 馆藏提供可操作的见解。

关键词

引用

@article{arxiv.2505.24538,
  title  = {Don't Erase, Inform! Detecting and Contextualizing Harmful Language in Cultural Heritage Collections},
  author = {Orfeas Menis Mastromichalakis and Jason Liartis and Kristina Rose and Antoine Isaac and Giorgos Stamou},
  journal= {arXiv preprint arXiv:2505.24538},
  year   = {2025}
}