通过模型内省理解与检测神经机器翻译中的幻觉
计算与语言
2023-02-28 v2
摘要
已知神经序列生成模型会产生“幻觉”,即生成与源文本无关的输出。这些幻觉具有潜在危害,然而目前尚不清楚它们在何种条件下出现以及如何减轻其影响。在本工作中,我们通过分析对比性幻觉与非幻觉输出的相对词元贡献(经由源文本扰动生成),首先识别了幻觉的内部模型症状。随后我们表明这些症状是自然幻觉的可靠指标,利用它们设计了一个轻量级幻觉检测器,该检测器在人工标注的英中和德英翻译测试集上优于无模型基线和基于质量估计或大型预训练模型的强分类器。
引用
@article{arxiv.2301.07779,
title = {Understanding and Detecting Hallucinations in Neural Machine Translation via Model Introspection},
author = {Weijia Xu and Sweta Agrawal and Eleftheria Briakou and Marianna J. Martindale and Marine Carpuat},
journal= {arXiv preprint arXiv:2301.07779},
year = {2023}
}
备注
Accepted at TACL