中文

通过单一中心文本攻击神经网络评估指标

计算与语言 2026-01-14 v2

摘要

强烈人类相关的评估指标是生成模型开发与改进的 essential 指南针,必须高度可靠且稳健。最近流行的基于嵌入的神经文本评估指标,如用于翻译任务的 COMET,已在研究与开发领域广泛使用。然而,由于神经网络的黑箱本质,无法保证其评估结果可靠。为提高此类指标可靠性与安全性的担忧,我们提出了一种方法,在离散空间中寻找单个对抗文本,该文本对所有测试情况都被评估为高质量,从而识别评估指标的漏洞。我们的方法找到的单个中心文本在 WMT'24 英日(En--Ja)和英德(En--De)翻译任务中分别实现了 79.1% 和 67.8% 的 COMET%,超越了使用 M2M100 这一通用翻译模型为每个源句子 individually 生成的翻译。此外,我们还确认了该方法找到的中心文本在多个语言对(如 Ja--En 和 De--En)之间具有普适性。

关键词

引用

@article{arxiv.2512.16323,
  title  = {Hacking Neural Evaluation Metrics with Single Hub Text},
  author = {Hiroyuki Deguchi and Katsuki Chousa and Yusuke Sakai},
  journal= {arXiv preprint arXiv:2512.16323},
  year   = {2026}
}

备注

Accepted at EACL2026 main