中文

深度学习驱动的烹饪领域多模态物体检测与运动分析

计算机视觉与模式识别 2025-09-19 v2 人工智能

摘要

本研究探索了现有模型并对其进行微调,以结合 YOLOv8 分割模型、基于手部关键点运动序列训练的 LSTM 模型以及 ASR(whisper-base),从而为 LLM(TinyLLaMa)提取充足的数据,以预测食谱并生成文本,创建烹饪过程的分步指南。所有数据均由作者收集,旨在构建一个稳健的特定任务系统,使其在复杂和具有挑战性的环境中表现最佳,证明了计算机视觉在厨房工作等日常活动中具有广泛的扩展性和无尽的应用潜力。这项工作将该领域扩展到了我们日常生活中更多关键任务。

关键词

引用

@article{arxiv.2509.00033,
  title  = {Deep Learning-Driven Multimodal Detection and Movement Analysis of Objects in Culinary},
  author = {Tahoshin Alam Ishat and Mohammad Abdul Qayum},
  journal= {arXiv preprint arXiv:2509.00033},
  year   = {2025}
}

备注

8 pages, 9 figures