中文

MM-PhyRLHF:面向多模态物理问答的强化学习框架

人工智能 2025-01-14 v2

摘要

LLM 的最新进展显示了其在文本摘要和生成等任务中的巨大潜力。然而,在解决需要算术计算和对概念有良好理解的复杂物理问题时,它们经常遇到困难。此外,许多物理问题包含图像,这些图像包含了理解问题上下文所需的重要细节。我们提出了一种基于 LMM 的聊天机器人来回答多模态物理选择题。为了进行领域适应,我们利用了 MM-PhyQA 数据集,该数据集包含印度高中水平的多模态物理问题。为了提高 LMM 的性能,我们实验了两种技术:RLHF (Reinforcement Learning from Human Feedback) 和图像描述。在图像描述中,我们为每张图像中的图表添加了详细的解释,以最大限度地减少幻觉和图像处理错误。我们进一步探索了 Reinforcement Learning from Human Feedback (RLHF) 方法的整合,该方法受 RLHF 中排序方法的启发,旨在增强模型类人的问题解决能力。RLHF 方法将人类反馈纳入 LLM 的学习过程中,提高了模型的问题解决技能、真实性和推理能力,减少了答案中的幻觉,并提高了质量,而不是使用普通的监督微调模型。我们采用 LLaVA 开源模型来回答多模态物理选择题,并比较了使用和不使用 RLHF 的性能。

关键词

引用

@article{arxiv.2404.12926,
  title  = {MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering},
  author = {Janak Kapuriya and Chhavi Kirtani and Apoorv Singh and Jay Saraf and Naman Lal and Jatin Kumar and Adarsh Raj Shivam and Astha Verma and Avinash Anand and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2404.12926},
  year   = {2025}
}