中文

使用隐喻式改写生成更具挑战性的跨文档事件指代解析数据集

计算与语言 2024-07-18 v1

摘要

最流行的跨文档事件指代解析 (CDEC) 数据集未能传达任务的真实难度,因为核心指代事件触发词 (指指事件的单词或短语) 之间的词汇多样性不足。此外,针对隐喻语言的事件数据集也十分稀缺,这限制了事件理解的关键研究方向。我们通过引入 ECB+META,作为 Event Coref Bank Plus (ECB+) 的词汇丰富版本,用于 CDEC 处理符号和隐喻语言。我们使用 ChatGPT 作为隐喻转换句子的工具,然后对转换后的句子中的原始事件触发词进行标记。通过这种方式,我们避免了对昂贵的指代链接的重新标注。我们展示的结果表明,表现良好的现有方法在 ECB+ 上表现良好,但在 ECB+META 上则表现不佳,从而为更具挑战性的数据集上的 CDEC 研究铺平了道路。代码/数据: https://github.com/ahmeshaf/llms_coref

关键词

引用

@article{arxiv.2407.11988,
  title  = {Generating Harder Cross-document Event Coreference Resolution Datasets using Metaphoric Paraphrasing},
  author = {Shafiuddin Rehan Ahmed and Zhiyong Eric Wang and George Arthur Baker and Kevin Stowe and James H. Martin},
  journal= {arXiv preprint arXiv:2407.11988},
  year   = {2024}
}

备注

Short Paper, ACL 2024