中文

问答建模改进是否在不同基准上保持一致?

计算与语言 2023-06-01 v3

摘要

问答(QA)建模改进(例如架构与训练过程的选择)是否在多样化的 QA 基准体系中持续成立?为研究此问题,我们引入一致性(concurrence)概念——若两个基准在一组建模方法上排序相似,则它们在该组方法上具有高一致性。我们在一组 20 种多样化建模方法上度量了 32 个 QA 基准之间的一致性,发现人工构建的基准彼此间具有高一致性,即便它们的段落与问题分布差异很大。令人惊讶的是,即便下采样的人工构建基准(即收集更少数据)与程序生成的基准(例如完形填空格式样例)也与人工构建基准具有高一致性。这些结果表明,尽管学界多年来聚焦于少数基准,所研究的建模改进具有广泛适用性。

关键词

引用

@article{arxiv.2102.01065,
  title  = {Do Question Answering Modeling Improvements Hold Across Benchmarks?},
  author = {Nelson F. Liu and Tony Lee and Robin Jia and Percy Liang},
  journal= {arXiv preprint arXiv:2102.01065},
  year   = {2023}
}

备注

31 pages, 13 figures; to appear at ACL 2023