中文

日语句子分类与命名实体识别任务中的相互增强效应

计算与语言 2023-07-24 v2

摘要

信息抽取(IE)是自然语言处理中的一个关键子领域。然而,对于传统上分割处理的句子分类与命名实体识别,这些独立子任务之间复杂的相互作用在很大程度上未被研究。在本研究中,我们提出一种整合分析,将句子分类与命名实体识别相融合,旨在揭示并理解这两个信息抽取子任务内的相互增强效应。为此,我们引入句子分类与命名实体识别多任务(SCNM)方法,结合句子分类(SC)与命名实体识别(NER)。我们为 SCNM 开发了句子到标签生成(SLG)框架,并构建了包含 SC 与 NER 的 Wikipedia 数据集。利用格式转换器,我们统一输入格式并采用生成模型生成 SC 标签、NER 标签及相关文本片段。我们提出约束机制(CM)以提高生成格式准确率。我们的结果显示,与独立任务相比,SCNM 中 SC 准确率提升 1.13 点、NER 提升 1.06 点,且 CM 将格式准确率从 63.61 提升至 100。研究结果表明 SC 与 NER 之间存在相互增强效应,且集成提升了两项任务的性能。我们还在单一 SC 任务上实现了 SLG 框架。其在两个不同日语 SC 数据集上取得了优于基线的准确率。值得注意的是,在少样本学习实验中,SLG 框架表现出远优于微调方法的性能。这些实证发现为证实 SLG 框架的有效性提供了额外证据。

关键词

引用

@article{arxiv.2307.10291,
  title  = {Mutual Reinforcement Effects in Japanese Sentence Classification and Named Entity Recognition Tasks},
  author = {Chengguang Gan and Qinghao Zhang and Tatsunori Mori},
  journal= {arXiv preprint arXiv:2307.10291},
  year   = {2023}
}

备注

25 pages, 12 figures, 19 tables. arXiv admin note: substantial text overlap with arXiv:2306.15978