中文

从模型到微理论:用于 grounded 问答的模型话题知识蒸馏

计算与语言 2024-12-25 v2

摘要

最近的推理方法(如链式思考、蕴涵推理)帮助用户理解语言模型(LM)如何回答单个问题,但它们对揭示模型整体理解或“理论”(关于问题话题的整体理解)几乎没有作用,这使得信任模型仍然困难。我们的目标是将此类理论——此处称为微理论(语言学中逻辑微理论的类比)——实现为一组封装模型对话题核心知识的句子。这些陈述系统性地共同蕴涵问题的答案,从而既能增强信任,又能提升性能。我们的 метод是首先填充知识存储库,包含(模型生成的)能够蕴涵训练问题答案的句子,然后将其蒸馏为简洁、通用且非冗余的核心微理论。我们展示,当添加到通用语料库(如维基百科)时,微理论可以提供语料库中可能不存在的关键话题信息,从而提高模型将答案 grounding 到可验证知识的能力(即展示答案如何由语料库中文档系统性地蕴涵,grounding 效果提升最高可达 +8%),以及这些 grounded 答案的准确率(提升最高可达 +8%)。我们还展示,在医疗领域的人类评估中,蒸馏后的微理论包含的关键事实比非蒸馏知识存储库高出显著。最后,我们展示,可以使用一种称为 pp-相关性 的概念来量化微理论对话题的覆盖度(以数据集为特征)。这些结果表明,微理论是对 LM 话题相关知识的有效蒸馏,它们可以有益地补充现有语料库,并为性能提升和对模型话题知识的可解释、可验证窗口提供可能。

关键词

引用

@article{arxiv.2412.17701,
  title  = {From Models to Microtheories: Distilling a Model's Topical Knowledge for Grounded Question Answering},
  author = {Nathaniel Weir and Bhavana Dalvi Mishra and Orion Weller and Oyvind Tafjord and Sam Hornstein and Alexander Sabol and Peter Jansen and Benjamin Van Durme and Peter Clark},
  journal= {arXiv preprint arXiv:2412.17701},
  year   = {2024}
}