中文

欣赏黄色是否意味着驾驶校车?语言模型中的语义泄漏

计算与语言 2025-05-19 v3

摘要

尽管语言模型广泛应用,但其偏见和意外行为仍鲜有人了解。本文我们发现并刻画了一种此前未讨论过的现象,即语义泄漏(semantic leakage),即模型会以意想不到的方式将提示中无关信息泄漏到生成结果中。我们提出了一种评估设置,用于检测语义泄漏,既可由人类检测,也可自动化。我们构建了多样化的测试套件用于诊断此类行为,并在13个主流模型中发现显著的语义泄漏。我们还表明,模型在英语之外的其他语言中也 exhibit 语义泄漏,并且在不同情境和生成场景下均表现出这种现象。这一发现揭示了语言模型中另一种类型的偏见,影响其生成模式和行为。

关键词

引用

@article{arxiv.2408.06518,
  title  = {Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language Models},
  author = {Hila Gonen and Terra Blevins and Alisa Liu and Luke Zettlemoyer and Noah A. Smith},
  journal= {arXiv preprint arXiv:2408.06518},
  year   = {2025}
}