中文

适应还是标注:开放域问答中领域自适应的挑战与干预方法

计算与语言 2022-12-21 v1

摘要

开放域问答(ODQA)的最新进展在标准维基百科风格的基准测试上展现出了令人瞩目的准确率。然而,当应用于截然不同领域的实际应用时,这些模型的鲁棒性和性能表现如何,尚不清晰。尽管已有一些工作研究了 ODQA 模型在测试域外(OOD)泛化时的性能,但这些研究仅在数据分布的保守偏移下进行,且通常只关注单一组件(即检索)而非端到端系统。作为回应,我们提出了一个更现实且更具挑战性的领域偏移评估设置,并通过大量实验研究了端到端模型的性能。我们发现,模型不仅未能泛化,而且高检索分数往往仍带来糟糕的答案预测准确率。随后,我们对不同类型的偏移进行了分类,并提出了一些技术,能够在面对新数据集时预测干预方法是否可能成功。最后,利用从该分析中获得的洞察,我们提出并评估了几种干预方法,这些方法将端到端答案 F1 分数最多提升了 24 个百分点。

关键词

引用

@article{arxiv.2212.10381,
  title  = {To Adapt or to Annotate: Challenges and Interventions for Domain Adaptation in Open-Domain Question Answering},
  author = {Dheeru Dua and Emma Strubell and Sameer Singh and Pat Verga},
  journal= {arXiv preprint arXiv:2212.10381},
  year   = {2022}
}