RSAT:结构化归因使小型语言模型成为可靠的表格推理器
计算与语言
2026-05-08 v2 人工智能
信息检索
机器学习
摘要
当语言模型回答表格问题时,用户无法验证哪些单元格inform哪些推理步骤。我们引入RSAT方法,通过训练小型语言模型(SLM,1-8B)生成带有表格证据中单元格级别引用的分步骤推理。阶段1(SFT)从验证的推理痕迹中教导结构化JSON输出格式。阶段2(GRPO)优化以NLI为基础的忠实性奖励,同时考虑引用有效性和简洁性。对于来自两个系列的六个模型-Qwen 2.5(1.5B/3B/7B)和Llama 3(1B/3B/8B)-RSAT在SFTalone基础上将忠实性提高3.7倍(0.224→0.826),引用有效性接近完美(0.992)。事后归因在格式成功率以下13%,确认归因必须集成到推理中而非后期添加。消融实验表明,忠实性奖励至关重要:移除后忠实性从0.97降至0.03。
引用
@article{arxiv.2605.00199,
title = {RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners},
author = {Jugal Gajjar and Kamalasankari Subramaniakuppusamy},
journal= {arXiv preprint arXiv:2605.00199},
year = {2026}
}
备注
8 pages, 8 tables, 9 figures, and a 3-page Appendix. Accepted at the SURGeLLM Workshop at ACL 2026 and will be included in the proceedings