Self-Translate-Train:通过内在能力提升大语言模型的跨语言迁移
计算与语言
2024-09-18 v2
摘要
通过微调多语言预训练模型实现零样本跨语言迁移在低资源语言方面显示出前景,但常因语言之间内部表示错位而受限。我们假设即使模型在微调时无法有效跨语言泛化,它仍捕获了对跨语言对应关系的有用信息,可用于跨语言迁移。我们通过 Self-Translate-Train 方法检验此假设:该方法使大语言模型将训练数据翻译成目标语言,并在自身生成的数据上进行微调。通过展示 Self-Translate-Train 超越零样本迁移,我们鼓励进一步探索更好的方法以激发大语言模型的跨语言能力。
引用
@article{arxiv.2407.00454,
title = {Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability},
author = {Ryokan Ri and Shun Kiyono and Sho Takase},
journal= {arXiv preprint arXiv:2407.00454},
year = {2024}
}