无交互式动物沟通翻译器的评估
计算与语言
2025-10-20 v1 机器学习
摘要
如果你拥有一台 AI whale-to-English 翻译器,如何验证其是否有效?是否需要与动物交互,或依赖温度等现实观察?我们提供理论依据和概念验证实验,表明交互甚至观察可能在足够复杂的语言下并非必需。仅凭英文输出即可评估翻译器,这在安全、伦理和成本方面提供了潜在优势。这是一种没有参考翻译可用的机器翻译质量评估 (MTQE) 方法。关键挑战在于识别“幻觉”——看似流畅且合理的错误翻译。我们提出使用分段翻译结合经典 NLP 洗牌测试来评估翻译器。该方法的思想是逐句翻译动物沟通,然后评估所得翻译的顺序连贯性是否高于随机排列。针对数据稀缺的人类语言和人造语言的概念验证实验表明了该评估方法的潜在实用性。这些人类语言实验仅用于在数据稀缺情境下验证我们的无参考指标。我们发现其与基于参考翻译的标准评估高度相关。我们还进行了理论分析,表明在翻译学习的早期阶段,交互可能并非必需或高效。
引用
@article{arxiv.2510.15768,
title = {On Non-interactive Evaluation of Animal Communication Translators},
author = {Orr Paradise and David F. Gruber and Adam Tauman Kalai},
journal= {arXiv preprint arXiv:2510.15768},
year = {2025}
}