增强问答系统:基于领域特定微调与迭代推理的比较研究
人工智能
2024-04-23 v2
摘要
本文探讨了领域特定模型微调与推理机制对大型语言模型(LLM)和检索增强生成(RAG)驱动的问答系统性能的影响。使用 FinanceBench SEC 财务文件数据集,我们观察到对于 RAG 系统,结合微调后的嵌入模型与微调后的 LLM 可实现更高的准确率,微调后的嵌入模型带来的提升相对更为显著。此外,在 RAG 之上采用推理迭代可进一步提升性能,使问答系统接近人类专家水平。我们讨论了这些发现的意义,提出了捕捉问答 AI 主要技术组件的结构化技术设计空间,并提供了针对此类组件做出高影响技术选择的建议。我们计划后续提供面向 AI 团队的可操作指南,并进一步调查领域特定增强在 RAG 中的影响以及诸如高级规划与推理等 agentic AI 能力的影响。
引用
@article{arxiv.2404.11792,
title = {Enhancing Q&A with Domain-Specific Fine-Tuning and Iterative Reasoning: A Comparative Study},
author = {Zooey Nguyen and Anthony Annunziata and Vinh Luong and Sang Dinh and Quynh Le and Anh Hai Ha and Chanh Le and Hong An Phan and Shruti Raghavan and Christopher Nguyen},
journal= {arXiv preprint arXiv:2404.11792},
year = {2024}
}
备注
Fixed typo of OODA's score on harder-question set in Table 2