中文

解码多样性:印度 AI 研究格局综述

计算与语言 2024-06-17 v1 人工智能 机器学习

摘要

本综述论文提供了关于大型语言模型(LLM)在印度语言领域的研究方向的全面概述。印度语言是说语于印度次大陆地区的语言,包括印度、巴基斯坦、孟加拉国、斯里兰卡、尼泊尔和不丹等。这些语言拥有丰富的文化和语言遗产,全球拥有超过 15 亿说话者。鉴于巨大的市场潜力和日益增长的对自然语言处理(NLP)基于应用程序的需求,针对印度语言的生成式应用程序在研究上提出了独特的挑战和机遇。我们的论文深入探讨了印度生成式建模的最新进展,贡献性地提供了研究方向的分类法,列出 84 项近期出版物。本文调查的研究方向包括 LLM 开发、微调现有 LLM、语料库的开发、基准测试和评估,以及关于特定技术、工具和应用程序的出版物。我们发现,跨所有出版物的研究者都强调了数据稀缺性、缺乏标准化以及印度语言独特语言复杂性的挑战。本工作旨在为在 NLP 领域、特别是专注于印度语言的研究者和从业者提供宝贵资源,并推动这些语言的 LLM 应用程序更准确、更高效的发展。

关键词

引用

@article{arxiv.2406.09559,
  title  = {Decoding the Diversity: A Review of the Indic AI Research Landscape},
  author = {Sankalp KJ and Vinija Jain and Sreyoshi Bhaduri and Tamoghna Roy and Aman Chadha},
  journal= {arXiv preprint arXiv:2406.09559},
  year   = {2024}
}

备注

27 pages, 1 figure