中文

我们需要谈谈数据:数据就绪在自然语言处理中的重要性

计算与语言 2021-10-12 v1 人工智能 计算机与社会 机器学习

摘要

在本文中,我们指出数据所处的状态是应用自然语言处理(NLP)项目失败的一个重要原因。我们认为,NLP的学术研究与在学术界之外的问题应用之间存在差距,而这种差距源于学术研究者与试图将研究成果应用于其业务运营的非学术同行之间缺乏相互理解。为了促进研究成果从学术界向非学术环境的转移,以及相应需求向学术界的回流,我们提出了一种基于数据就绪等级(Data Readiness Levels)的方法来改善研究者与外部利益相关者之间关于数据的可访问性、有效性和实用性的沟通。尽管该方法仍处于起步阶段,但已在多个与私人和公共部门利益相关者开展的创新与研究项目中进行了迭代和应用。最后,我们邀请研究者和从业者分享他们的经验,从而为旨在提高对NLP数据就绪重要性的认识的工作体系做出贡献。

关键词

引用

@article{arxiv.2110.05464,
  title  = {We Need to Talk About Data: The Importance of Data Readiness in Natural Language Processing},
  author = {Fredrik Olsson and Magnus Sahlgren},
  journal= {arXiv preprint arXiv:2110.05464},
  year   = {2021}
}