GrASP:一个用于提取与探索人类可解释文本模式的库
计算与语言
2022-06-20 v2 人工智能
机器学习
摘要
数据探索是每一个数据科学与机器学习项目(包括涉及文本数据的项目)的重要步骤。我们提供了一种新颖的语言工具,以公开可用的 Python 库形式用于从文本数据中提取模式。该库集成了已有 GrASP 算法的首个公开实现。它允许用户使用若干通用内置语言属性(如上下位词、词性标注与句法依存标签)——正如原始算法所设想的——以及通过实现两个函数即可纳入库的领域特定自定义属性来提取模式。该库配备基于 Web 的界面,使人用户能借助所提取模式便捷地探索数据,使用互补的以模式为中心与以样本为中心的视图:前者包含每条提取模式的自然语言解读与统计信息;后者展示每条提取模式在训练样本上的应用。我们在分类(垃圾检测与论证挖掘)、模型分析(机器翻译)以及数据集伪迹发现(SNLI 与 20Newsgroups)中展示了该库的效用。
引用
@article{arxiv.2104.03958,
title = {GrASP: A Library for Extracting and Exploring Human-Interpretable Textual Patterns},
author = {Piyawat Lertvittayakumjorn and Leshem Choshen and Eyal Shnarch and Francesca Toni},
journal= {arXiv preprint arXiv:2104.03958},
year = {2022}
}
备注
Proceedings of Language Resources and Evaluation (LREC), Marseille, France pp 6093-6103 (2022)