开放世界中的长尾问答
计算与语言
2023-05-12 v1 人工智能
机器学习
摘要
真实世界数据常具有开放长尾分布,构建支持多种任务的统一 QA 模型对实际 QA 应用至关重要。然而,扩展先前 QA 方法并非易事,因为它们要么需要访问具有充足样本的已见任务,要么未显式建模来自未见任务的样本。在本文中,我们定义开放长尾问答(OLTQA)为从长尾分布数据中学习并优化已见与未见 QA 任务的性能。我们提出一种 OLTQA 模型,鼓励头部、尾部与未见任务间的知识共享,并显式从大型预训练语言模型(LM)中挖掘知识。具体而言,我们通过细粒度组件池组织模型,并为输入动态组合这些组件以促进知识共享。进一步引入检索后重排序框架以选择上下文示例,引导 LM 生成表达 QA 任务知识的文本。此外,引入两阶段训练方法,通过来自 LM 的知识蒸馏(KD)预训练框架,随后通过自适应互 KD 方法联合训练框架与 QA 模型。在我们从 43 个现有 QA 数据集构建的大规模 OLTQA 数据集上,我们的模型持续优于最先进水平。我们在 \url{https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/oltqa} 发布代码与数据。
引用
@article{arxiv.2305.06557,
title = {Long-Tailed Question Answering in an Open World},
author = {Yi Dai and Hao Lang and Yinhe Zheng and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2305.06557},
year = {2023}
}
备注
ACL2023 Main Track Long Paper