面向低资源语言答案句选择的交叉语言知识蒸馏
计算与语言
2025-01-06 v1
摘要
尽管在英语答案句选择(AS2)任务上已取得令人印象深刻的性能,但对于缺乏大型标注数据集的语言而言情况并非如此。在这项工作中,我们提出从强大的英语 AS2 教师模型进行交叉语言知识蒸馏(CLKD),作为一种无需目标语言标注数据即可为低资源语言训练 AS2 模型的方法。为评估我们的方法,我们引入 1) Xtr-WikiQA,一个基于翻译的涵盖 9 种附加语言的 WikiQA 数据集,以及 2) TyDi-AS2,一个包含超过 70K 问题、横跨 8 种类型学多样语言的多语言 AS2 数据集。我们在 Xtr-WikiQA 和 TyDi-AS2 上使用多个教师模型、多种单语言与多语言预训练语言模型(PLM)作为学生模型,以及单语言与多语言训练进行了大量实验。结果表明,CLKD 要么优于、要么媲美使用同等数量标注数据的有监督微调以及机器翻译与教师模型相结合的方法。我们的方法有可能为低资源语言启用更强的 AS2 模型,而 TyDi-AS2 可作为最大的多语言 AS2 数据集服务于研究界的进一步研究。
引用
@article{arxiv.2305.16302,
title = {Cross-Lingual Knowledge Distillation for Answer Sentence Selection in Low-Resource Languages},
author = {Shivanshu Gupta and Yoshitomo Matsubara and Ankit Chadha and Alessandro Moschitti},
journal= {arXiv preprint arXiv:2305.16302},
year = {2025}
}
备注
Accepted at ACL 2023 as a long paper (Findings). Datasets are available at https://huggingface.co/datasets/AmazonScience/xtr-wiki_qa and https://huggingface.co/datasets/AmazonScience/tydi-as2