利用强化学习优化面向领域聊天机器人的检索增强生成
计算与语言
2024-01-17 v1 人工智能
摘要
随着大型语言模型(LLM)的出现,对话助手在领域用例中变得普遍。LLM通过训练获得了上下文问答的能力,而检索增强生成(RAG)进一步使机器人能够回答特定领域的问题。本文描述了一种基于RAG的方法,用于构建一个使用常见问题解答(FAQ)数据回答用户查询的聊天机器人。我们使用infoNCE损失训练了一个内部的检索嵌入模型,实验结果表明,该内部模型在检索准确性和域外(OOD)查询检测方面都显著优于众所周知的通用公共嵌入模型。作为LLM,我们使用了一个基于开放API的付费ChatGPT模型。我们注意到,先前检索到的上下文可用于为特定的查询模式/序列(例如,后续查询)生成答案。因此,存在优化LLM令牌数量和成本的空间。假设一个固定的检索模型和一个LLM,我们使用强化学习(RL)来优化LLM令牌的数量。具体来说,我们提出了一个位于RAG外部的基于策略的模型,该模型通过策略动作与RAG管道交互,并更新策略以优化成本。该策略模型可以执行两个动作:获取FAQ上下文或跳过检索。我们使用基于开放API的GPT-4作为奖励模型。然后,我们在多个训练聊天会话上使用策略梯度训练一个策略模型。作为策略模型,我们实验了一个公共的gpt-2模型和一个内部的BERT模型。通过将所提出的基于RL的优化与相似度阈值相结合,我们能够在略微提高准确性的同时实现显著的成本节约。尽管我们展示了FAQ聊天机器人的结果,但所提出的RL方法是通用的,可以在任何现有的RAG管道上进行实验。
引用
@article{arxiv.2401.06800,
title = {Reinforcement Learning for Optimizing RAG for Domain Chatbots},
author = {Mandar Kulkarni and Praveen Tangarajan and Kyung Kim and Anusua Trivedi},
journal= {arXiv preprint arXiv:2401.06800},
year = {2024}
}