DRIFT:一种用于科学文献历时性分析的工具包
计算与语言
2021-09-13 v5
摘要
在这项工作中,我们向 NLP 社区及更广泛的研究群体介绍一款用于研究语料历时性分析的应用。我们开源了一款名为 DRIFT 的易用工具,使研究者能够追踪多年来的研究趋势与发展。分析方法整理自高被引研究工作,并适当加入我们自己的若干方法。简言之,部分分析方法包括:关键词提取、词云、利用 Productivity 预测衰退/停滞/增长趋势、利用 Acceleration 图追踪二元词组、发现词语的语义漂移(Semantic Drift)、利用相似度追踪趋势等。为展示该工具的效用与效能,我们对 arXiv 仓库的 cs.CL 语料进行案例研究,并从分析方法中得出推断。该工具包及相关代码可在此获取:https://github.com/rajaswa/DRIFT。
引用
@article{arxiv.2107.01198,
title = {DRIFT: A Toolkit for Diachronic Analysis of Scientific Literature},
author = {Abheesht Sharma and Gunjan Chhablani and Harshit Pandey and Rajaswa Patil},
journal= {arXiv preprint arXiv:2107.01198},
year = {2021}
}
备注
Accepted at EMNLP-2021 (System Demonstration Track)