中文

CATER:利用 LLM 先锋 multidimensional、reference-independent 翻译质量评估范式

计算与语言 2024-12-17 v1 人工智能

摘要

本文介绍了综合 AI 辅助翻译编辑比率(CATER),一种新型且完全基于提示的框架,用于评估机器翻译(MT)质量。通过精心设计的基于提示的协议,CATER 利用大语言模型(LLM)扩展了传统以参考为导向的指标,提供一种多维度、reference-independent 的评估,涵盖语言准确性、语义忠实性、语境连贯性、风格恰当性和信息完整性。CATER 的独特优势在于其即时可行性:只需提供源文本和目标文本以及标准化提示,LLM 即可快速识别错误、量化编辑工作量并生成类别级和整体得分。该方法消除了对预计算参考或领域特定资源的需求,使其能够即时适应多种语言、体裁和用户优先级,通过可调整的权重和提示修改。CATER 的 LLM 启用策略支持更细致的评估,捕捉日益挑战当代 MT 系统的细微遗漏、幻觉以及话语层次的偏移。通过将框架如 MQM 和 DQF 的概念严谨性与 LLM 基于评估的可扩展性和灵活性相结合,CATER 成为全球研究人员、开发者和专业翻译家的有价值工具。该框架和示例提示均已公开,鼓励社区驱动的细化和进一步实证验证。

关键词

引用

@article{arxiv.2412.11261,
  title  = {CATER: Leveraging LLM to Pioneer a Multidimensional, Reference-Independent Paradigm in Translation Quality Evaluation},
  author = {Kurando IIDA and Kenjiro MIMURA},
  journal= {arXiv preprint arXiv:2412.11261},
  year   = {2024}
}

备注

17pages,1sample prompt