CaRT:教会 LLM 代理在知足时知道何时知足
人工智能
2025-10-10 v1 计算与语言
机器学习
摘要
许多任务需要学习模型在实际行动前,通过多轮交互战略性地收集相关信息。战略信息收集要求模型不仅有效获取信息,还要在收集信息后何时停止以作出决定,以避免过度思考或在行动时走偏离正确路径。本文我们正式化了这一问题,提出 Counterfactuals and Reasoning for Termination(CaRT)方法,用于教会 LLM 何时停止寻求信息。为恰当地学习何时终止,CaRT 使用反事实轨迹对 LLM 进行微调,一个轨迹中终止是恰当的,而该轨迹的最小修改版本中终止则不恰当。它训练 LLM 解释终止决定的依据,经由言语推理方式将此能力注入基础 LLM。我们在两个领域实现 CaRT:交互式医学诊断和数学问题求解。在两个领域,我们发现 CaRT 在信息收集效率和任务成功率方面优于其他微调方法。
引用
@article{arxiv.2510.08517,
title = {CaRT: Teaching LLM Agents to Know When They Know Enough},
author = {Grace Liu and Yuxiao Qu and Jeff Schneider and Aarti Singh and Aviral Kumar},
journal= {arXiv preprint arXiv:2510.08517},
year = {2025}
}