NADIR: 用于印度语言非自回归音译的差分注意力流
计算与语言
2026-01-21 v1 人工智能
摘要
在这项工作中,我们认为并非所有序列到序列任务都需要自回归(AR)模型的强归纳偏置。多语言音译、代码重构、语法纠正或文本规范化等任务通常依赖于局部依赖关系,在这些任务中使用AR模型的全部建模能力可能大材小用,从而在其高准确率和高推理延迟之间产生权衡。虽然非自回归(NAR)模型提供了速度,但它们通常会出现幻觉和长度控制不佳的问题。为了探索这种权衡,我们专注于印度语言的多语言音译任务,并引入了NADIR,这是一种新颖的NAR架构,旨在平衡速度和准确性。NADIR集成了差分Transformer和混合专家机制,使其能够在没有序列依赖的情况下稳健地建模复杂的字符映射。与最先进的AR基线相比,NADIR实现了超过13倍的加速。它保持了具有竞争力的平均字符错误率15.78%,而AR模型为14.44%,标准NAR等效模型为21.88%。重要的是,NADIR将重复错误减少了49.53%,替换错误减少了24.45%,遗漏错误减少了32.92%,插入错误减少了16.87%。这项工作为构建快速可靠的NAR系统提供了实用的蓝图,有效地弥合了AR准确性与实时大规模部署需求之间的差距。
引用
@article{arxiv.2601.12389,
title = {NADIR: Differential Attention Flow for Non-Autoregressive Transliteration in Indic Languages},
author = {Lakshya Tomar and Vinayak Abrol and Puneet Agarwal},
journal= {arXiv preprint arXiv:2601.12389},
year = {2026}
}
备注
Accepted at the AAAI Conference on Artificial Intelligence (AAAI 2026)