DiaTool-DPO:面向工具增强型大型语言模型的多轮直接偏好优化
计算与语言
2025-07-15 v2 机器学习
摘要
工具增强型大型语言模型(TA-LLM)在实际应用中表现出色,但在处理不完整查询和超出范围请求方面面临挑战。虽然现有方法主要依赖专家轨迹的监督式微调,但我们提出DiaTool-DPO,通过直接偏好优化来增强TA-LLM的对话能力。我们将TA-LLM交互建模为马尔可夫决策过程,包含5种不同的对话状态,并将用户查询分为3种类型based on其状态转换轨迹。我们自动构建正确与错误对话流程的配对轨迹数据集,引入针对对话控制的专用目标损失函数。我们的全面评估表明,DiaTool-DPO接近GPT-4o的性能(信息收集达94.8%,工具调用拒绝达91%),显著优于基线方法(分别提升了44%和9.6%),同时保持核心功能。我们的方法为开发无需额外专家演示或人工标注即可应对多样化实际场景的TA-LLM提供了新的可能性。
引用
@article{arxiv.2504.02882,
title = {DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models},
author = {Sunghee Jung and Donghun Lee and Shinbok Lee and Gaeun Seo and Daniel Lee and Byeongil Ko and Junrae Cho and Kihyun Kim and Eunggyun Kim and Myeongcheol Shin},
journal= {arXiv preprint arXiv:2504.02882},
year = {2025}
}
备注
Accepted to SIGDIAL 2025