重新思考低资源语言的有效与稳健多语言重新对齐
机器人学
2025-11-11 v1 人工智能
计算机视觉与模式识别
摘要
重新对齐是一种有前景的策略,用于改进多语言语言模型的跨语言迁移。然而,实证结果是混合的,往往不可靠,尤其是对于与英语在句法或语义上遥远或资源匮乏的语言(LRLs)。此外,词汇重新对齐工具常常依赖高质量的平行数据,而这对许多 LRLs 来说可能稀缺或噪声。本文我们进行了一项广泛的实证研究,以探讨重新对齐是否真正受益于使用所有可用语言,还是是否通过战略性选择的子集可以实现相当或甚至更好的跨语言迁移,并研究对 LRLs 的影响。我们的受控实验表明,重新对齐对于 LRLs 来说尤其有效,并且使用精心挑选的、在语言学上具有多样性的子集可以匹配完整的多语言对齐,甚至在对不可见 LRLs 方面超过它。这表明有效的重新对齐并不要求详尽的语言覆盖,而且可以在受到明智语言选择指导的情况下降低数据收集开销,同时保持高效和稳健。
引用
@article{arxiv.2511.06496,
title = {A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving},
author = {Keke Long and Jiacheng Guo and Tianyun Zhang and Hongkai Yu and Xiaopeng Li},
journal= {arXiv preprint arXiv:2511.06496},
year = {2025}
}