中文

南亚语言文本、语音与多模态研究的全景目录

计算与语言 2025-01-03 v1 信息检索 机器学习

摘要

我们审阅了2022年1月至2024年10月期间,南亚语言领域关于文本语言处理、多模态模型和语音处理的最新文献,聚焦21种低资源南亚语言,包括 Saraiki、Assamese、Balochi、Bhojpuri、Bodo、Burmese、Chhattisgarhi、Dhivehi、Gujarati、Kannada、Kashmiri、Konkani、Khasi、Malayalam、Meitei、Nepali、Odia、Pashto、Rajasthani、Sindhi 和 Telugu。我们识别出趋势、挑战与未来研究方向,采用分步骤方法,结合相关性分类和基于大型语言模型 (LLM) 的聚类。我们的目标是为关注南亚语言的 NLP 研究者提供南亚语言技术的最新发展的全面概览。

关键词

引用

@article{arxiv.2501.00029,
  title  = {A Breadth-First Catalog of Text Processing, Speech Processing and Multimodal Research in South Asian Languages},
  author = {Pranav Gupta},
  journal= {arXiv preprint arXiv:2501.00029},
  year   = {2025}
}