TEN:神经符号化的表格显式化
计算与语言
2025-08-14 v1 人工智能
摘要
我们提出了一种神经符号方法 TEN,用于从半结构化输入文本中提取表格数据。对于不一致使用特殊分隔符来分隔列和行的文本输入,此任务尤其具有挑战性。由于幻觉及其无法强制执行硬约束,纯神经方法的性能较差。TEN 在大语言模型(LLM)上使用结构分解提示——一种专门的思维链提示方法——来生成初始表格,此后使用符号检查器不仅评估该表格的格式正确性,还检测幻觉或遗忘的情况。符号检查器的输出由批评 LLM 处理以生成修复表格的指导,并在自我调试循环中呈现给原始 LLM。我们广泛的实验表明,TEN 在多个数据集和指标上显著优于纯神经基线,实现了显著更高的精确匹配准确率和大幅降低的幻觉率。一项 21 名参与者的用户研究进一步证实,TEN 的表格被评为显著更准确(平均分:5.0 vs 4.3;p = 0.021),并且在易于验证和纠正方面始终受青睐,参与者在超过 60% 的情况下偏好我们的方法。
引用
@article{arxiv.2508.09324,
title = {TEN: Table Explicitization, Neurosymbolically},
author = {Nikita Mehrotra and Aayush Kumar and Sumit Gulwani and Arjun Radhakrishna and Ashish Tiwari},
journal= {arXiv preprint arXiv:2508.09324},
year = {2025}
}