中文

超越 I.I.D.:基于知识库的问答的三层泛化

计算与语言 2021-02-24 v6 人工智能 机器学习

摘要

现有基于知识库的问答(KBQA)研究主要在标准 i.i.d 假设下运作,即关于问题的训练分布与测试分布相同。然而,在大规模 KB 上 i.i.d 既难以合理实现也非所愿,因为 1)真实用户分布难以捕捉;2)从巨大空间中随机采样训练样本数据效率极低。相反,我们建议 KBQA 模型应具备三层内置泛化:i.i.d、组合式和零样本。为促进具有更强泛化能力的 KBQA 模型发展,我们构建并发布了一个包含 64,331 个问题的大规模高质量新数据集 GrailQA,并为全部三层泛化提供评测设置。此外,我们提出了一种基于 BERT 的新型 KBQA 模型。我们的数据集与模型结合使我们首次彻底检验并证明了如 BERT 的预训练上下文嵌入在 KBQA 泛化中的关键作用。

关键词

引用

@article{arxiv.2011.07743,
  title  = {Beyond I.I.D.: Three Levels of Generalization for Question Answering on Knowledge Bases},
  author = {Yu Gu and Sue Kase and Michelle Vanni and Brian Sadler and Percy Liang and Xifeng Yan and Yu Su},
  journal= {arXiv preprint arXiv:2011.07743},
  year   = {2021}
}

备注

Accepted to TheWebConf 2021 (previously WWW)