中文

名中何意?通过匿名化缓解文本嵌入中的名称偏差

计算与语言 2025-02-06 v1 人工智能 机器学习

摘要

文本嵌入模型常表现出源于其训练数据的偏差。本文研究了一种迄今为止未被探索的文本嵌入偏差:由文本中存在的名称\textit{名称}(如人物、地点、组织等)引起的偏差。我们的研究表明,文本嵌入模型中名称偏差\textit{名称偏差}的存在可能导致在评估主题相似性时得出错误结论。文本嵌入可能基于文本中的名称错误地指示文本间的相似性,即使它们的实际语义内容并无相似之处;或者仅仅因为文本中的名称而指示不相似性,即使文本在语义上匹配。我们首先展示了不同文本嵌入模型中名称偏差的存在,然后提出了在推理过程中进行文本匿名化\textit{文本匿名化}的方法,该方法涉及移除对名称的引用,同时保留文本的核心主题。在两个下游自然语言处理任务上验证了匿名化方法的有效性,取得了显著的性能提升。我们这种简单且无需训练优化的方法,为缓解名称偏差提供了一种实用且易于实施的解决方案。

关键词

引用

@article{arxiv.2502.02903,
  title  = {What is in a name? Mitigating Name Bias in Text Embeddings via Anonymization},
  author = {Sahil Manchanda and Pannaga Shivaswamy},
  journal= {arXiv preprint arXiv:2502.02903},
  year   = {2025}
}