ReacTOD:基于受限神经符号的零样图灵状态跟踪
计算与语言
2026-05-20 v1 人工智能
摘要
任务导向对话系统(处理交易、预订和服务请求)需要可预测的行为,但所需实际延迟的中等规模大语言模型容易产生幻觉和格式错误,导致错误的动作(例如为错误日期预订酒店)。我们提出ReacTOD,一种受限神经符号架构,将NLU重新表述为受确定性验证控制的自纠正ReAct循环中的离散工具调用。受限的ReAct循环实现了迭代自我纠正,在MultiWOZ上的准确率提升最高可达9.3个百分点。符号验证器在每一次对话状态更新时强制执行动作合规性、模式符合性和指代一致性,实现了93.1%的自我纠正率,并生成结构化的执行轨迹。增量状态预测和按需历史检索保持提示简洁,实证上改善了参数受限模型的指令遵循。在MultiWOZ 2.1上,ReacTOD实现了新的零样本最佳状态:gpt-oss-20B达到52.71%的联合目标准确率,超越前一最佳14个百分点;Qwen3-8B达到47.34%,仅需8B参数。在Schema引导对话(SGD)基准上,ReacTOD使用Claude-Opus-4.6达到80.68%的JGA,实现了完全端到端评估(包括预测域),Qwen3-32B达到64.09%——表明在无需任务特定训练数据的情况下实现了跨基准泛化。
引用
@article{arxiv.2605.19077,
title = {ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking},
author = {Yanjun Lin and Zimo Xiao and Kartik Natarajan and Mahesh Sankaranarayanan and Niraj Nawanit and Rakshit Parashar and Austin Zhang and Karthik Konaraddi and Rishita Mote and Wei Niu},
journal= {arXiv preprint arXiv:2605.19077},
year = {2026}
}
备注
Accepted at TrustNLP Workshop at ACL 2026