TRIP-Bench: 面向真实场景中长期交互式智能体的基准
人工智能
2026-02-03 v1 机器学习
摘要
随着基于LLM的智能体在日益复杂的真实世界场景中部署,现有基准未能充分代表诸如强制全局约束、协调多工具推理以及适应长期多轮交互中用户行为变化等关键挑战。为弥合这一差距,我们引入TRIP-Bench,一个基于真实旅行规划场景的长期 horizon 基准。TRIP-Bench利用真实世界数据,提供18个精选工具和40+项旅行需求,并支持自动化评估。其包含难度不同的数据划分;难划分强调长期且模糊的交互、风格迁移、可行性变化以及迭代版本修订。对话可达15轮用户交互,可能涉及150+次工具调用,上下文总数可超过20万 token。实验表明,即便是先进模型在 easy 划分上也仅 achieves 最多50%的成功率,而在 hard 子集上性能跌破10%。我们进一步提出GTPO,一种基于专门奖励归一化和奖励差分的在线多轮强化学习方法。应用于Qwen2.5-32B-Instruct时,GTPO在满足约束方面和交互鲁棒性方面均优于Gemini-3-Pro。我们预计TRIP-Bench将推动实用长期交互式智能体的发展,而GTPO将为稳健的长期训练提供有效的在线RL配方。
引用
@article{arxiv.2602.01675,
title = {TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios},
author = {Yuanzhe Shen and Zisu Huang and Zhengyuan Wang and Muzhao Tian and Zhengkang Guo and Chenyang Zhang and Shuaiyu Zhou and Zengjie Hu and Dailin Li and Jingwen Xu and Kaimin Wang and Wenhao Liu and Tianlong Li and Fengpeng Yue and Feng Hong and Cao Liu and Ke Zeng},
journal= {arXiv preprint arXiv:2602.01675},
year = {2026}
}
备注
40 pages, 6figures