中文

面向习语语料库构建的游戏化众包方法

计算与语言 2022-01-21 v1

摘要

学习习语表达被视为第二语言学习中最具挑战性的阶段之一,因为其含义不可预测。在自然语言处理应用(如机器翻译和句法分析)中识别习语也面临类似困境。高质量用法样本的缺乏不仅加剧了人类的学习难度,也给人工智能系统带来挑战。本文介绍了一种游戏化众包方法,用于收集习语表达的语料学习材料;设计了一个消息机器人作为异步多人游戏,供母语者相互竞争,同时提供习语和非习语用法示例并对其他玩家的条目进行评分。与本领域经典的众包标注工作不同,本文在文献中首次实现并测试了用于习语语料库构建的众创与众评方法。该方法与语言无关,并在两种语言上与传统数据准备技术进行了对比评估。在不同激励手段(即游戏化可供性与金钱奖励)下监测了众包参与者的反应。结果表明,所提方法在收集目标材料方面十分有效,并且尽管是一种显式众包方法,仍被参与者认为具有娱乐性和实用性。该方法已显示出潜力,可加速为不同自然语言构建习语语料库,用作第二语言学习材料、有监督习语识别系统的训练数据或词典学研究的样本。

关键词

引用

@article{arxiv.2102.00881,
  title  = {Gamified Crowdsourcing for Idiom Corpora Construction},
  author = {Gülşen Eryiğit and Ali Şentaş and Johanna Monti},
  journal= {arXiv preprint arXiv:2102.00881},
  year   = {2022}
}

备注

25 pages, 8 figures, 6 tables