多语言套利:优化数据池以加速多语言进展
计算与语言
2024-08-28 v1 人工智能
摘要
合成数据的使用在近期最先进技术的突破中发挥了关键作用。然而,过度依赖单一“神谕”教师模型生成数据已被证明会导致模型崩溃并引发偏见传播。这些局限性在多语言环境中尤为明显,因为缺乏一个在所有语言中均表现优异的通用教师模型,这带来了重大挑战。在本工作中,我们通过引入“多语言套利”来解决这些极端差异,该方法利用多个模型在特定语言上的性能差异。为此,我们策略性地将样本路由到具有不同语言独特优势的多样化模型池中。通过对最先进模型的详尽实验,我们的研究表明,套利技术能够带来显著的性能提升,远超依赖单一教师模型的效果。特别是,与最佳单一教师模型相比,采用多语言套利后,所有语言的平均胜率提升高达56.5%。我们观察到,在我们池中资源最少的语言上,性能提升最为显著。
引用
@article{arxiv.2408.14960,
title = {Multilingual Arbitrage: Optimizing Data Pools to Accelerate Multilingual Progress},
author = {Ayomide Odumakinde and Daniel D'souza and Pat Verga and Beyza Ermis and Sara Hooker},
journal= {arXiv preprint arXiv:2408.14960},
year = {2024}
}