Chitrarth:面向十亿人的视觉语言桥接
人工智能
2025-02-24 v1 计算与语言
计算机视觉与模式识别
摘要
最近的多模态基础模型主要在英语或高资源欧洲语言数据上进行训练,这限制了其针对其他中低资源语言的适用性。为此,我们引入 Chitrarth(Chitra:图像;Artha:意义),一个面向丰富语言多样性和跨语言视觉推理的包容性视觉语言模型(VLM),具体针对 10 种主要印度语言进行设计。我们的模型有效地将最先进的(SOTA)多语言大语言模型(LLM)与视觉模块集成,主要在多语言图像文本数据上进行训练。此外,我们还引入 BharatBench,一个用于评估跨各种印度语言的 VLMs 的综合框架,最终促进了更具多样性和有效性的人工智能系统。我们的模型在低资源语言基准测试中取得 SOTA 成绩,同时保持了英语的效率。通过我们的研究,我们旨在在多模态能力方面设定新基准,显著优于现有模型,并为此领域的未来进步奠定基础。
关键词
引用
@article{arxiv.2502.15392,
title = {Chitrarth: Bridging Vision and Language for a Billion People},
author = {Shaharukh Khan and Ayush Tarun and Abhinav Ravi and Ali Faraz and Akshat Patidar and Praveen Kumar Pokala and Anagha Bhangare and Raja Kolla and Chandra Khatri and Shubham Agarwal},
journal= {arXiv preprint arXiv:2502.15392},
year = {2025}
}