探索机器翻译的上下文示例生成
计算与语言
2025-06-03 v1
摘要
大型语言模型凭借其仅需少量示例即可展现的卓越上下文学习能力,在各种任务中表现出色。因此,机器翻译领域中上下文示例的最优选择已被广泛研究。然而,这些研究预设了存在包含人工标注对的示例池,这使得它们难以适用于难以满足此假设的低资源语言。为克服这一局限,本文探索了机器翻译中上下文示例生成的研究方向。具体而言,我们提出了 Demonstration Augmentation for Translation (DAT),这是一种简单而有效的方法,无需依赖任何外部资源即可生成示例对。该方法建立在相关性和多样性这两个先前标准之上,这两个标准在先前工作中被视为上下文示例选择的关键因素。通过在缺乏人工标注对的低资源语言上的实验与分析,我们表明 DAT 相比基线实现了更优的翻译质量。此外,我们研究了在测试时逐步累积生成的示例对以构建并重用示例池的潜力。我们的实现已公开于 https://github.com/aiclaudev/DAT。
引用
@article{arxiv.2506.00507,
title = {Exploring In-context Example Generation for Machine Translation},
author = {Dohyun Lee and Seungil Chad Lee and Chanwoo Yang and Yujin Baek and Jaegul Choo},
journal= {arXiv preprint arXiv:2506.00507},
year = {2025}
}
备注
Accepted to ACL 2025 Findings