中文

ReacTOD:基于受限神经符号的零样图灵状态跟踪

计算与语言 2026-05-20 v1 人工智能

摘要

任务导向对话系统(处理交易、预订和服务请求)需要可预测的行为,但所需实际延迟的中等规模大语言模型容易产生幻觉和格式错误,导致错误的动作(例如为错误日期预订酒店)。我们提出ReacTOD,一种受限神经符号架构,将NLU重新表述为受确定性验证控制的自纠正ReAct循环中的离散工具调用。受限的ReAct循环实现了迭代自我纠正,在MultiWOZ上的准确率提升最高可达9.3个百分点。符号验证器在每一次对话状态更新时强制执行动作合规性、模式符合性和指代一致性,实现了93.1%的自我纠正率,并生成结构化的执行轨迹。增量状态预测和按需历史检索保持提示简洁,实证上改善了参数受限模型的指令遵循。在MultiWOZ 2.1上,ReacTOD实现了新的零样本最佳状态:gpt-oss-20B达到52.71%的联合目标准确率,超越前一最佳14个百分点;Qwen3-8B达到47.34%,仅需8B参数。在Schema引导对话(SGD)基准上,ReacTOD使用Claude-Opus-4.6达到80.68%的JGA,实现了完全端到端评估(包括预测域),Qwen3-32B达到64.09%——表明在无需任务特定训练数据的情况下实现了跨基准泛化。

关键词

引用

@article{arxiv.2605.19077,
  title  = {ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking},
  author = {Yanjun Lin and Zimo Xiao and Kartik Natarajan and Mahesh Sankaranarayanan and Niraj Nawanit and Rakshit Parashar and Austin Zhang and Karthik Konaraddi and Rishita Mote and Wei Niu},
  journal= {arXiv preprint arXiv:2605.19077},
  year   = {2026}
}

备注

Accepted at TrustNLP Workshop at ACL 2026