CoVe:通过约束引导的验证训练交互式工具使用智能体
人工智能
2026-03-03 v1
摘要
开发多轮交互式工具使用智能体具有挑战,因为现实世界的用户需求往往复杂且模糊,但智能体必须执行确定性动作来满足这些需求。为此,我们引入CoVe(Constraint-Verification,约束验证),一个用于训练交互式工具使用智能体的后训练数据合成框架,旨在确保数据复杂性和正确性。CoVe通过定义明确的任务约束开始,这些约束发挥双重作用:它们指导复杂轨迹的生成,同时作为确定性验证器用于评估轨迹质量。这使得为监督式微调(SFT)和强化学习(RL)创建高质量训练轨迹和准确奖励信号成为可能。我们在具有挑战性的-基准数据集上进行评估,证明了该框架的有效性。值得注意的是,我们紧凑的CoVe-4B模型在航空和零售领域分别实现了43.0%和59.4%的成功率;其整体性能显著优于规模相似的强大基线,与规模为其的模型保持竞争力。这些结果表明CoVe为训练最先进的交互式工具使用智能体提供了有效且高效的数据合成路径。为支持未来研究,我们开源了代码、训练好的模型以及用于训练的12K组高质量轨迹。
引用
@article{arxiv.2603.01940,
title = {CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification},
author = {Jinpeng Chen and Cheng Gong and Hanbo Li and Ziru Liu and Zichen Tian and Xinyu Fu and Shi Wu and Chenyang Zhang and Wu Zhang and Suiyun Zhang and Dandan Tu and Rui Liu},
journal= {arXiv preprint arXiv:2603.01940},
year = {2026}
}