中文

信息抽取中相互强化效应的多语言数据集与实证验证

计算与语言 2026-04-14 v5

摘要

相互强化效应 (MRE) 描述在信息抽取中,词级任务与句级任务在联合建模时能够相互提升。虽然已有研究在日语中报告了 MRE,但其在不同语言和任务设置下的普适性尚未获得实证验证,主要due于缺乏多语言 MRE 数据集。为此,我们引入多语言 MRE 混合数据集 (MMM),覆盖英文、日语和中文的 21 个子数据集。我们提出一种基于大语言模型的翻译与对齐框架,显著降低手动标注工作量,同时保持 MRE 任务的结构要求。基于 MMM,我们采用统一的输入输出框架训练开域信息抽取模型,开展大量实验,包括完全调谨消除实验和基于 MRE 混合数据构建有知识的 verbalizer。实验结果表明,76% 的 MMM 子数据集在多语言环境下均一致显示出相互强化效应。这些发现为在多语言设置下系统性地实证验证 MRE 提供了依据,并展示了其在信息抽取中的实际价值。

关键词

引用

@article{arxiv.2407.10953,
  title  = {A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information Extraction},
  author = {Chengguang Gan and Sunbowen Lee and Qingyu Yin and Yunhao Liang and Xinyang He and Hanjun Wei and Younghun Lim and Shijian Wang and Hexiang Huang and Qinghao Zhang and Shiwen Ni and Tatsunori Mori},
  journal= {arXiv preprint arXiv:2407.10953},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings