论多语言问答大语言模型的校准
计算与语言
2024-04-16 v2 机器学习
摘要
多语言预训练大语言模型(LLM)在问答(QA)这一自然语言理解核心任务上极为有效,在多个多语言基准上取得高准确率。然而,其置信度校准程度如何却鲜为人知。本文中,我们全面基准测试了若干多语言 LLM(MLLM)在多种 QA 任务上的校准情况。我们开展了广泛实验,涵盖仅编码器、编码器-解码器与仅解码器 QA 模型(参数规模从 110M 到 7B),以及包括高资源与低资源在内的多样语言。我们研究了分布内、分布外与跨语言迁移设定下校准的不同维度,并探究了改进策略,含事后方法与正则化微调。对于 LlaMa2 等仅解码器 LLM,我们额外发现上下文学习可改善多语言数据上的置信度校准。我们还进行了若干消融实验,以研究语言距离、语言语料规模与模型规模对校准的影响,以及多语言模型相较其单语对应模型在多样任务与语言上的表现。实验表明,多语言 QA 模型对非英语语言校准较差,而在微调/校准中引入少量低成本翻译的多语言样本可有效提升校准性能。
引用
@article{arxiv.2311.08669,
title = {On the Calibration of Multilingual Question Answering LLMs},
author = {Yahan Yang and Soham Dan and Dan Roth and Insup Lee},
journal= {arXiv preprint arXiv:2311.08669},
year = {2024}
}
备注
Preprint. Under Submission