中文

探索表到文本方法对利用领域混合数据增强基于 LLM 的问答系统的影响

计算与语言 2024-04-10 v2

摘要

利用领域特定数据增强用于问答 (QA) 的大语言模型 (LLMs) 已引起广泛关注。然而,领域数据常以混合格式存在,包括文本和半结构化表格,这对信息的无缝集成构成了挑战。表到文本生成通过促进将混合数据转换为统一文本格式的语料库,成为一种有前景的解决方案。尽管该技术已被自然语言处理 (NLP) 社区广泛研究,但目前尚无比较分析探讨不同表到文本方法生成的语料库如何影响 QA 系统的性能。在本文中,我们通过两个步骤填补这一研究空白。首先,我们创新地将表到文本生成集成到利用领域混合数据增强基于 LLM 的 QA 系统的框架中。随后,我们利用该框架在真实世界工业数据上,针对两种类型的 QA 系统(DSFT 和 RAG 框架)与四种代表性方法(Markdown 格式、模板序列化、基于 TPLM 的方法和基于 LLM 的方法)进行了广泛实验。基于实验结果,我们得出了一些经验性发现,并探讨了某些方法成功背后的潜在原因。我们希望本工作的发现能为学术界和工业界开发鲁棒的 QA 系统提供有价值的参考。

关键词

引用

@article{arxiv.2402.12869,
  title  = {Exploring the Impact of Table-to-Text Methods on Augmenting LLM-based Question Answering with Domain Hybrid Data},
  author = {Dehai Min and Nan Hu and Rihui Jin and Nuo Lin and Jiaoyan Chen and Yongrui Chen and Yu Li and Guilin Qi and Yun Li and Nijun Li and Qianren Wang},
  journal= {arXiv preprint arXiv:2402.12869},
  year   = {2024}
}

备注

Accepted to NAACL 2024 Industry Track Paper