中文

基于自训练框架的无监督复杂表格推理优化技术

计算与语言 2024-06-24 v2 人工智能 数据库

摘要

结构化表格数据是众多领域中的基本数据类型,对表格进行推理的能力对于回答问题和验证假设至关重要。然而,为复杂推理任务构建标注数据耗时费力,且标注数据的数量仍不足以支撑现实应用的复杂需求。为应对标注不足的挑战,我们提出了一种用于无监督复杂表格推理(UCTR-ST)的自训练框架,通过生成具有复杂逻辑的多样化合成数据来实现。具体而言,UCTR-ST整合了若干关键技术:我们通过“程序管理”组件聚合多样化程序并在表格上执行,并通过强大的“程序转换”模块弥合程序与文本之间的鸿沟,生成具有复杂逻辑的自然语言句子。此外,我们利用“表格-文本操纵器”优化流程以处理联合表格-文本推理场景。整个框架利用自训练技术来挖掘无标签训练数据,在真实数据上测试时带来了显著的性能提升。实验结果表明,UCTR-ST在不同任务和领域上达到了有监督模型性能的90%以上,降低了对人工标注的依赖。此外,我们的方法可作为数据增强技术,显著提升低资源领域中有监督模型的性能。

关键词

引用

@article{arxiv.2212.10097,
  title  = {Optimization Techniques for Unsupervised Complex Table Reasoning via Self-Training Framework},
  author = {Zhenyu Li and Xiuxing Li and Sunqi Fan and Jianyong Wang},
  journal= {arXiv preprint arXiv:2212.10097},
  year   = {2024}
}

备注

Submitted to TKDE, preprint version