Data-to-Value:一种面向自然语言项目的评估优先方法论
计算与语言
2022-01-20 v1 统计方法学
摘要
大数据,即在规模上对数据进行收集、存储与处理,近年来因由 HDFS/Hadoop/Spark 等应用级分布式并行操作系统驱动的商用计算机集群的出现而成为可能,此类基础设施彻底变革了大规模数据挖掘。为使数据挖掘项目更稳健地成功,人们开发了若干方法论(如 CRISP-DM、SEMMA、KDD),但它们未考虑(1)极大规模的处理,(2)处理文本(非结构化)数据(即自然语言处理(NLP,“文本分析”)),以及(3)非技术性因素(如法律、伦理、项目管理层面)。为弥补这些不足,本文提出一种称为“Data to Value”(D2V)的新方法论,其由一套详尽的问题目录引导,以避免大数据文本分析项目团队在面对方法论常见的抽象框图时与主题脱节。
引用
@article{arxiv.2201.07725,
title = {Data-to-Value: An Evaluation-First Methodology for Natural Language Projects},
author = {Jochen L. Leidner},
journal= {arXiv preprint arXiv:2201.07725},
year = {2022}
}
备注
9 pages, 6 figures, 4 tables