面向结构化数据问答的自我纠正蒸馏
计算与语言
2025-11-18 v2 人工智能
摘要
结构化数据问答(QA),包括表格问答、知识图谱(KG)问答和时序KG问答,是重要的研究领域。大型语言模型(LLM)的进展推动了像TrustUQA这样的统一结构化QA框架取得了显著进展。然而,这些框架在应用于小规模LLM时面临挑战,因为小规模LLM在生成结构化查询时容易出错。为提升小规模LLM的结构化数据QA能力,我们提出了一种自我纠正蒸馏(Self-Correction Distillation, SCD)方法。在SCD中,设计了一种错误提示机制(Error Prompt Mechanism, EPM),用于在推理期间检测错误并提供定制化错误消息,同时设计了两阶段蒸馏策略,将大规模LLM的查询生成和错误纠正能力传递给小规模LLM。在5个基准测试中进行实验,涵盖3种结构化数据类型,结果表明我们的SCD在小规模LLM(8B)上实现了最佳性能和优异的泛化能力,部分数据集上接近GPT-4的表现。此外,配备EPM的大规模LLM在大多数数据集上超越了当前最好的结果。
引用
@article{arxiv.2511.07998,
title = {Self-Correction Distillation for Structured Data Question Answering},
author = {Yushan Zhu and Wen Zhang and Long Jin and Mengshu Sun and Ling Zhong and Zhiqiang Liu and Juan Li and Lei Liang and Chong Long and Chao Deng and Junlan Feng},
journal= {arXiv preprint arXiv:2511.07998},
year = {2025}
}
备注
Accepted to AAAI 2026