中文

CaRT:教会 LLM 代理在知足时知道何时知足

人工智能 2025-10-10 v1 计算与语言 机器学习

摘要

许多任务需要学习模型在实际行动前,通过多轮交互战略性地收集相关信息。战略信息收集要求模型不仅有效获取信息,还要在收集信息后何时停止以作出决定,以避免过度思考或在行动时走偏离正确路径。本文我们正式化了这一问题,提出 Counterfactuals and Reasoning for Termination(CaRT)方法,用于教会 LLM 何时停止寻求信息。为恰当地学习何时终止,CaRT 使用反事实轨迹对 LLM 进行微调,一个轨迹中终止是恰当的,而该轨迹的最小修改版本中终止则不恰当。它训练 LLM 解释终止决定的依据,经由言语推理方式将此能力注入基础 LLM。我们在两个领域实现 CaRT:交互式医学诊断和数学问题求解。在两个领域,我们发现 CaRT 在信息收集效率和任务成功率方面优于其他微调方法。

关键词

引用

@article{arxiv.2510.08517,
  title  = {CaRT: Teaching LLM Agents to Know When They Know Enough},
  author = {Grace Liu and Yuxiao Qu and Jeff Schneider and Aarti Singh and Aviral Kumar},
  journal= {arXiv preprint arXiv:2510.08517},
  year   = {2025}
}