有限计算资源下传统 VQA 模型的性能分析
计算机视觉与模式识别
2025-02-11 v1
摘要
在计算资源有限的实际应用场景中, 在视觉问答 (VQA) 中有效地整合视觉与文本信息 presents significant 挑战. 本文探讨了在计算约束条件下传统模型的性能, 尤其关注数值和计数问题. 我们评估了基于双向 GRU (BidGRU)、GRU、双向 LSTM (BidLSTM) 和卷积神经网络 (CNN) 的模型, 分析了不同词汇大小、微调策略和嵌入维度的影响. 实验结果表明, 嵌入维度为 300 且词汇大小为 3000 的 BidGRU 模型在不引入大型模型计算开销的前提下, 实现了最佳的整体性能. 消融研究强调了注意力机制和计数信息在资源受限环境下处理复杂推理任务中的重要性. 我们的研究为开发适用于计算资源受限环境的更高效 VQA 模型提供了宝贵的见解.
引用
@article{arxiv.2502.05738,
title = {Performance Analysis of Traditional VQA Models Under Limited Computational Resources},
author = {Jihao Gu},
journal= {arXiv preprint arXiv:2502.05738},
year = {2025}
}
备注
6 pages, 1 figure, 5 tabels, the paper has been accepted by the PRML'25 conference