Khana:一个全面的印度菜肴数据集
计算机视觉与模式识别
2025-09-09 v1 人工智能
机器学习
摘要
随着全球对多样化美食体验兴趣的增长,食物图像模型对于提高食物相关应用的准确性至关重要,这些应用包括食物识别、食谱建议、饮食跟踪和自动餐厅规划。尽管已有大量食物数据集,但在捕捉印度菜肴细微差别方面仍存在明显不足,这主要是由于印度菜肴的地区多样性、复杂的烹饪方式以及缺乏覆盖其全部范围的综合标记数据集。通过这一探索,我们发现Khana——一个新的基准数据集,用于印度菜肴的图像分类、分割和检索。Khana通过建立印度菜肴的分类学框架,提供约13.1万张图片,覆盖80个标签,每张图片分辨率为500x500像素。本文描述了数据集的创建过程,并在分类、分割和检索任务上评估了最先进的模型作为基线。Khana通过为研究人员提供一个全面且具有挑战性的基准,弥合了研究与开发之间的差距,同时也为那些利用印度菜肴丰富 tapestry 为开发者创建实际应用提供了宝贵资源。网页:https://khana.omkar.xyz
引用
@article{arxiv.2509.06006,
title = {Khana: A Comprehensive Indian Cuisine Dataset},
author = {Omkar Prabhu},
journal= {arXiv preprint arXiv:2509.06006},
year = {2025}
}