中文

超越图像:视觉与文本数据的自适应融合用于食物分类

计算机视觉与模式识别 2025-08-06 v4 人工智能 计算机与社会 机器学习

摘要

本研究提出了一种新颖的多模态食物识别框架,其有效结合视觉与文本模态以提升分类准确率与鲁棒性。所提方法采用动态多模态融合策略,自适应地整合来自单模态视觉输入与互补文本元数据的特征。该融合机制旨在最大化利用信息内容,同时减轻缺失或不一致模态数据带来的不利影响。该框架在 UPMC Food-101 数据集上进行了严格评估,图像与文本的单模态分类准确率分别达到 73.60% 与 88.84%。当两种模态融合时,模型取得了 97.84% 的准确率,优于多种最先进方法。大量实验分析证明了所提设置的鲁棒性、适应性与计算效率,凸显了其在真实世界多模态食物识别场景中的实际适用性。

关键词

引用

@article{arxiv.2308.02562,
  title  = {Beyond Images: Adaptive Fusion of Visual and Textual Data for Food Classification},
  author = {Prateek Mittal and Puneet Goyal and Joohi Chauhan},
  journal= {arXiv preprint arXiv:2308.02562},
  year   = {2025}
}