面向学术写作的资源自动构建及基于非正式词识别与复述系统的评估
计算与语言
2020-03-09 v1
摘要
我们提出了首个自动构建学术写作资源的方法。其目标是构建一个写作辅助系统,能够自动编辑文本,使其更好地符合学术写作风格。在现有学术资源(如当代美国英语语料库(COCA)学术词表、新学术词表以及学术搭配词表)的基础上,我们还探索如何动态构建此类资源,用于自动识别非正式或非学术词汇及短语。这些资源采用不同的通用方法进行编译,可扩展至不同领域与语言。我们描述了通过系统实现对这些资源的评估。该系统由非正式词识别(IWI)、学术候选复述生成以及复述排序组件构成。为生成候选并在上下文中排序,我们使用了 PPDB 和 WordNet 复述资源。我们利用语境中的概念(CoInCO)“全词”词汇替换数据集,分别用于非正式词识别和复述生成实验。我们的非正式词识别组件取得了 82% 的 F-1 分数,显著优于分层分类器基线。本工作的主要贡献是一种领域无关的方法论,用于构建面向写作辅助的针对性资源。
引用
@article{arxiv.2003.02955,
title = {Automatic Compilation of Resources for Academic Writing and Evaluating with Informal Word Identification and Paraphrasing System},
author = {Seid Muhie Yimam and Gopalakrishnan Venkatesh and John Sie Yuen Lee and Chris Biemann},
journal= {arXiv preprint arXiv:2003.02955},
year = {2020}
}