面向食物领域的问答系统:多模态知识图谱的混合生成与多样性分析
计算与语言
2025-07-10 v1
摘要
我们提出了一个统一的食物领域问答框架,将大规模多模态知识图谱(MMKG)与生成式 AI 结合。我们的 MMKG 链接 13,000 个食谱、3,000 个食材、140,000 个关系和 14,000 个图像。我们使用 40 个模板和 LLaVA/DeepSeek 生成 40,000 个 QA 对。对 Meta LLaMA 3.1-8B 和 Stable Diffusion 3.5-Large 进行联合微调,BERTScore 提升 16.2%,FID 降低 37.8%,CLIP 对齐度提升 31.1%。诊断分析包括 CLIP-based 不匹配检测(从 35.2% 降至 7.3%)和 LLaVA-driven 幻觉检查,确保事实和视觉忠实性。混合检索-生成策略实现 94.1% 的准确图像重用和 85% 的合成 adequacy。我们的结果表明,结构化知识与多模态生成共同提高了食物问答系统的可靠性和多样性。
引用
@article{arxiv.2507.06571,
title = {Enhancing Food-Domain Question Answering with a Multimodal Knowledge Graph: Hybrid QA Generation and Diversity Analysis},
author = {Srihari K B and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2507.06571},
year = {2025}
}