基于推理链的印度食物视觉问答
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
印度饮食文化和烹饪的浩瞳性多样性凸显了现有视觉问答(VQA)系统偏向西方食物的主要短板。最近尝试为印度食物构建 VQA 数据集是一步重要的进展。然而,这些方法遵循两步流程:先生成答案,再解释预期答案。在本工作中,我们主张食物 VQA 需要遵循多步骤推理过程才能得出准确答案,尤其是在印度食物语境下,这涉及理解复杂的烹饪背景和识别各种食物之间的关系。我们在 QA 上创建推理链,仅需最小限度的人工介入。我们对较小的大语言模型和视觉语言模型进行微调,使用经自动验证的推理链进一步通过强化学习进行训练。实验表明,加入推理链后,基线模型的准确率提升了约 10 个百分点。我们对印度食物 VQA 任务增加推理链的效果进行了详细分析。索引词 - FoodVQA、推理链、强化学习、知识图谱。
引用
@article{arxiv.2511.01213,
title = {Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering},
author = {Riddhi Jain and Manasi Patwardhan and Parijat Deshpande and Venkataramana Runkana},
journal= {arXiv preprint arXiv:2511.01213},
year = {2025}
}
备注
10 pages, 11 figures, 6 tables