中文

我应该分享这个翻译吗?评估机器翻译中用户依赖的质量反馈

计算与语言 2025-10-03 v3 人工智能

摘要

随着人们在工作和日常生活中越来越多地使用 AI 系统,帮助他们负责任地使用 AI 的反馈机制变得迫切需要,尤其是在用户不具备评估 AI 预测质量能力的场景中。我们研究了一个真实的机器翻译(MT)场景,单语用户首先在没有质量反馈、随后在有质量反馈的情况下决定是否分享 MT 输出。我们比较了四种类型的质量反馈:通过(1)错误高亮和(2)LLM 解释直接向用户提供翻译质量评估的显式反馈,以及通过(3)回译和(4)问答(QA)表帮助用户比较 MT 输入和输出的隐式反馈。我们发现,除错误高亮外,所有反馈类型均显著提高了决策准确性和适当的依赖性。值得注意的是,隐式反馈尤其是 QA 表,在决策准确性、适当依赖性和用户感知方面产生的增益显著大于显式反馈,其在有用性和信任度上获得了最高评分,而在认知负担上获得了最低评分。

关键词

引用

@article{arxiv.2505.24683,
  title  = {Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation},
  author = {Dayeon Ki and Kevin Duh and Marine Carpuat},
  journal= {arXiv preprint arXiv:2505.24683},
  year   = {2025}
}

备注

EMNLP 2025