中文

利用极噪声众包标注识别中文意见表达

计算与语言 2022-04-25 v1

摘要

近期意见表达识别(OEI)的研究严重依赖人工构建训练语料的质量与规模,而这往往极难满足。众包是解决该问题的一种实用方案,旨在创建大规模但质量无保证的语料。本工作中,我们研究利用极噪声众包标注进行中文 OEI,以极低成本构建了一个数据集。遵循 zhang 等人(2021),我们将所有标注视为针对众包标注者的金标准来训练标注者适配模型,并使用由所有标注者混合而成的合成专家来测试模型。由于该用于测试的标注者混合在训练阶段从未被显式建模,我们提出通过一种恰当的 mixup 策略生成合成训练样本,以使训练与测试高度一致。在我们所构建数据集上的模拟实验表明,众包对 OEI 极具前景,且我们所提出的标注者 mixup 可进一步增强众包建模。

关键词

引用

@article{arxiv.2204.10714,
  title  = {Identifying Chinese Opinion Expressions with Extremely-Noisy Crowdsourcing Annotations},
  author = {Xin Zhang and Guangwei Xu and Yueheng Sun and Meishan Zhang and Xiaobin Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2204.10714},
  year   = {2022}
}

备注

Accepted by ACL 2022 main conf