中文

图像-文本对的多模态学习:通过热量估计量化改进

机器学习 2025-11-18 v1 计算机视觉与模式识别

摘要

本文确定了短文本输入(本案例中为菜名)相对于仅使用图像的基线模型能否提高热量估计的程度,以及是否存在统计显著性改进。利用 TensorFlow 库和由 Google 提供的 Nutrition5k 数据集训练了两个模型:一个仅使用图像的 CNN 和一个接受文本和图像作为输入的多模态 CNN。热量估计的平均绝对误差 (MAE) 从 84.76 kcal 降低至 83.70 kcal(改进 1.25%),当使用多模态模型时。

关键词

引用

@article{arxiv.2511.11705,
  title  = {Multimodal ML: Quantifying the Improvement of Calorie Estimation Through Image-Text Pairs},
  author = {Arya Narang},
  journal= {arXiv preprint arXiv:2511.11705},
  year   = {2025}
}