通过单一中心文本攻击神经网络评估指标
计算与语言
2026-01-14 v2
摘要
强烈人类相关的评估指标是生成模型开发与改进的 essential 指南针,必须高度可靠且稳健。最近流行的基于嵌入的神经文本评估指标,如用于翻译任务的 COMET,已在研究与开发领域广泛使用。然而,由于神经网络的黑箱本质,无法保证其评估结果可靠。为提高此类指标可靠性与安全性的担忧,我们提出了一种方法,在离散空间中寻找单个对抗文本,该文本对所有测试情况都被评估为高质量,从而识别评估指标的漏洞。我们的方法找到的单个中心文本在 WMT'24 英日(En--Ja)和英德(En--De)翻译任务中分别实现了 79.1% 和 67.8% 的 COMET%,超越了使用 M2M100 这一通用翻译模型为每个源句子 individually 生成的翻译。此外,我们还确认了该方法找到的中心文本在多个语言对(如 Ja--En 和 De--En)之间具有普适性。
引用
@article{arxiv.2512.16323,
title = {Hacking Neural Evaluation Metrics with Single Hub Text},
author = {Hiroyuki Deguchi and Katsuki Chousa and Yusuke Sakai},
journal= {arXiv preprint arXiv:2512.16323},
year = {2026}
}
备注
Accepted at EACL2026 main