面向条件问答的大语言模型应用探索
计算与语言
2023-12-05 v1
摘要
本研究深入探讨了大型语言模型在具有挑战性的条件问答领域的能力与局限性。利用条件问答数据集并聚焦于 T5 和 UL2 等生成式模型,我们评估了 LLM 在多种问题类型上的性能。研究结果表明,微调后的 LLM 在某些情况下能够超越最先进性能,即使未完全编码所有输入上下文,其在 Yes/No 问题上的精确匹配率和 F1 分数也提高了 7-8 个百分点。然而,这些模型在抽取式问答中遇到挑战,落后 SOTA 超过 10 个百分点,且在降低注入虚假信息风险方面也存在困难。一项使用预言机检索器的研究强调了有效证据检索的关键作用,凸显了该领域对先进解决方案的需求。此外,我们强调了评估指标对性能评估的显著影响,并呼吁采用更全面的评估框架。任务的复杂性、观察到的性能差异以及对有效证据检索的需求,凸显了该领域面临的持续挑战,并表明未来工作需要集中于改进训练任务和探索基于提示的技术,以提升 LLM 在条件问答任务中的性能。
引用
@article{arxiv.2312.01143,
title = {Towards leveraging LLMs for Conditional QA},
author = {Syed-Amad Hussain and Parag Pravin Dakle and SaiKrishna Rallabandi and Preethi Raghavan},
journal= {arXiv preprint arXiv:2312.01143},
year = {2023}
}