迈向忠实且鲁棒的基于证据问答大型语言模型专家
计算与语言
2024-06-04 v5 机器学习
摘要
大型语言模型(LLM)在提供更忠实和可追溯的答案方面的进展对于各种研究和实践工作至关重要。实现这一目标的途径之一是基于可靠来源构建答案。然而,这种基于证据的问答(Evidence-Based QA)在引用正确来源(来源质量)和真实呈现来源内信息(答案可归因性)方面被证明对 LLM 而言效果不足。在这项工作中,我们系统地研究了如何鲁棒地微调 LLM 以提高来源质量和答案可归因性。具体而言,我们引入了一种带有自动化数据质量过滤器的数据生成流水线,该流水线可以大规模合成多样化的高质量训练和测试数据。我们还引入了四个测试集来基准测试微调后专家模型的鲁棒性。广泛的评估表明,在合成数据上进行微调可以提高域内和域外的性能。此外,我们表明,数据质量(可通过提出的质量过滤器大幅改善)比数量在改善基于证据的问答方面更为重要。
引用
@article{arxiv.2402.08277,
title = {Towards Faithful and Robust LLM Specialists for Evidence-Based Question-Answering},
author = {Tobias Schimanski and Jingwei Ni and Mathias Kraus and Elliott Ash and Markus Leippold},
journal= {arXiv preprint arXiv:2402.08277},
year = {2024}
}