通过自知识蒸馏在少资源场景下促进泛化跨语言问答
计算与语言
2023-10-02 v1
摘要
尽管多语言抽取式问答(QA)取得了实质性进展,但在各语言上均具有高且均匀分布的模型性能仍然具有挑战性,尤其是对于资源有限的语种。我们研究跨语言迁移,主要关注泛化跨语言迁移(G-XLT)任务,其中问题语言与上下文语言不同——这一挑战迄今受到的关注有限。我们的方法旨在利用在大规模数据集上训练的高性能多语言模型,并辅以数千条跨语言对齐的 QA 样本,来增强跨语言 QA 迁移。我们提出的策略结合了跨语言采样与生成中的先进自蒸馏训练,以应对前述挑战。值得注意的是,我们引入了新颖的 mAP@k 系数来微调自知识蒸馏损失,动态调节教师模型知识以实现平衡且有效的知识迁移。我们广泛评估了我们的方法,以评估抽取式 QA 中的 XLT 和 G-XLT 能力。结果表明,我们的自知识蒸馏方法显著优于标准交叉熵微调。重要的是,与利用大量机器翻译数据的强基线相比,尽管在资源受限环境下运作这一挑战巨大,我们的方法仍展现出有竞争力的结果,即便在零样本场景下亦如此。除性能提升外,我们通过全面分析与消融研究提供了有价值的见解,进一步证实了该方法的优势与局限。总之,我们提出了一种实用方案,通过高效利用少量数据资源来改善跨语言 QA 迁移。
引用
@article{arxiv.2309.17134,
title = {Promoting Generalized Cross-lingual Question Answering in Few-resource Scenarios via Self-knowledge Distillation},
author = {Casimiro Pio Carrino and Carlos Escolano and José A. R. Fonollosa},
journal= {arXiv preprint arXiv:2309.17134},
year = {2023}
}
备注
Submitted to the Journal of Artificial Intelligence Research (JAIR)