中文

基于大语言模型的长尾食物数据集域适应增强方法

计算机视觉与模式识别 2025-11-21 v1

摘要

为食物识别训练模型具有挑战性,因为训练样本通常从互联网爬取,与在自由生活环境中用户捕获的图片视觉上存在差异。除了这一域漂移问题外,真实世界的食物数据集倾向于呈长尾分布,且某些菜品类别之间的细微差异在视觉上难以区分。在本文中,我们提出了一个基于大语言模型(LLM)的框架来解决食物识别中的这些挑战。我们首先利用LLM解析食物图像生成食物标题和原料。随后,我们将来自不同域的生成文本和食物图像投影到共享嵌入空间以最大化配对相似性。最后,我们使用来自两种食物数据集的对齐双模态特征进行识别。通过这个简单框架,我们展示了我们提出的方法在针对长尾数据分布、域适应和细粒度分类分别优化的现有方法上均表现出优于性。

关键词

引用

@article{arxiv.2511.16037,
  title  = {LLMs-based Augmentation for Domain Adaptation in Long-tailed Food Datasets},
  author = {Qing Wang and Chong-Wah Ngo and Ee-Peng Lim and Qianru Sun},
  journal= {arXiv preprint arXiv:2511.16037},
  year   = {2025}
}