中文

半自动限定描述标注:初步报告

计算与语言 2017-12-27 v1

摘要

指称表达生成(Referring Expression Generation, REG)的研究常利用在受控实验中由人类受试者产生的限定描述语料库。此类实验对于研究指称现象及许多其他现象至关重要,但可能包含相当数量的噪声。人类受试者可能容易注意力不集中,或干脆误解手头任务,因此所引发的数据可能包含大量歧义或格式不良的描述。此外,REG 语料库通常为研究语义相关现象而收集,且常需将所引发的描述(及其输入语境)标注上相应的语义属性。正如许多其他领域一样,这可能需要大量时间且需熟练标注者。为解决这两类困难——数据质量差与标注成本高——本文讨论了一种用于标注 REG 数据收集实验中人类受试者所产生的限定描述的半自动方法。该方法利用简单规则建立词与义之间的关联,旨在促进产生 REG 语料库的实验设计。

关键词

引用

@article{arxiv.1712.08933,
  title  = {Semi-automatic definite description annotation: a first report},
  author = {Danillo da Silva Rocha and Alex Gwo Jen Lan and Ivandre Paraboni},
  journal= {arXiv preprint arXiv:1712.08933},
  year   = {2017}
}