真实场景中的机器翻译
计算与语言
2025-12-16 v3
摘要
大型语言模型(LLM)在翻译等任务中表现出色,在零样本和少样本设置下展现出许多语言对上极具竞争力的性能。但与专用的神经机器翻译模型不同,LLM并未在任何与翻译相关的目标上进行训练。是什么解释了其卓越的翻译能力?这些能力是否源于训练数据中的“附带双语现象”(Briakou et al. 2023)?指令微调是否对此有所贡献?LLM是否能够对齐并利用来自互联网不同角落、不太可能放入单个上下文窗口的语义相同或相似的单语内容?基于近期研究和不断增长的用户体验,我对此主题提供了一些思考。我的工作假设是,LLM的翻译能力源于两种不同类型的预训练数据,这些数据可能以不同方式被模型内化。我讨论了通过实证检验这一“二元性”假设的前景,及其对深度学习时代重新概念化人类与机器翻译的意义。
引用
@article{arxiv.2505.23548,
title = {Translation in the Wild},
author = {Yuri Balashov},
journal= {arXiv preprint arXiv:2505.23548},
year = {2025}
}
备注
4 figures