计算历史语言学与南亚语言多样性
计算与语言
2022-03-24 v1
摘要
南亚是众多语言的家园,其中许多语言严重缺乏对新语言技术的获取。这种语言多样性也造就了一个利于比较语言学、接触语言学和历史语言学研究的环境——这些领域需要从多种语言中收集广泛数据。我们主张,数据分散性(而非稀缺性)是南亚语言技术发展中的主要障碍,并认为语言历史的研究与克服该障碍独具契合性。我们回顾了南亚NLP与历史比较语言学及其交叉领域的最新进展,描述了我们及他人在该领域的当前努力。我们也提供了打破数据壁垒的新策略。
引用
@article{arxiv.2203.12524,
title = {Computational historical linguistics and language diversity in South Asia},
author = {Aryaman Arora and Adam Farris and Samopriya Basu and Suresh Kolichala},
journal= {arXiv preprint arXiv:2203.12524},
year = {2022}
}
备注
14 pages; accepted to ACL 2022 Theme Track