语言田野数据管理与分析系统——LiFE演示
计算与语言
2022-03-23 v1
摘要
在拟议的演示中,我们将展示一款新软件——语言田野数据管理与分析系统(LiFE,https://github.com/kmi-linguistics/life)——一个开源、基于网页的语言数据管理与分析应用,可对从田野收集的语言数据进行系统存储、管理、共享与使用。该应用允许用户存储带丰富注释/标注的词汇项、句子、段落、视听内容;生成交互式与印刷版词典;并利用这些数据训练和使用自然语言处理工具与模型以服务于多种目的。由于其基于网页,它还支持多人无缝协作及数据、模型等的相互共享。系统后端采用基于Python的Flask框架与MongoDB,前端使用HTML、CSS与Javascript。界面允许创建多个可与其他用户共享的项目。后端以RDF格式存储数据,以便通过语义网技术将其作为关联数据发布于网页上——目前它使用OntoLex-Lemon存储词汇数据,使用Ligt存储行间 glossed 文本,并在内部将其链接至DBpedia与WordNet等其他关联词库与数据库。此外,它支持使用scikit-learn与HuggingFace Transformers库训练NLP系统,也可使用这些库训练的任何模型——尽管用户界面本身提供的系统调优选项有限,但外部训练的模型可轻松集成于应用中;同样,数据集本身可轻松导出为JSON或CSV等标准机器可读格式,供其他程序与流水线使用。
引用
@article{arxiv.2203.11443,
title = {Demo of the Linguistic Field Data Management and Analysis System -- LiFE},
author = {Siddharth Singh and Ritesh Kumar and Shyam Ratan and Sonal Sinha},
journal= {arXiv preprint arXiv:2203.11443},
year = {2022}
}
备注
Accepted in the 19th International Conference on Natural Language Processing (ICON-2021)