GETReason:通过分层多智能体推理增强图像上下文提取
计算机视觉与模式识别
2025-06-04 v3 计算与语言
摘要
来自事件的具有公共重要性的图像蕴含着有价值的上下文信息,这对新闻业和教育至关重要。然而,现有方法往往难以准确提取这种相关性。为解决这一问题,我们引入了 GETReason(Geospatial Event Temporal Reasoning),这是一个超越表面级图像描述以推断更深层次上下文含义的框架。我们提出,提取全局事件、时间和地理空间信息能够增强对图像重要性的理解。此外,我们引入了 GREAT(Geospatial Reasoning and Event Accuracy with Temporal Alignment),一种用于评估基于推理的图像理解的新指标。我们的分层多智能体方法使用推理加权指标进行评估,结果表明可以推断出有意义的见解,从而有效地将图像与其更广泛的事件上下文联系起来。
引用
@article{arxiv.2505.21863,
title = {GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent Reasoning},
author = {Shikhhar Siingh and Abhinav Rawat and Chitta Baral and Vivek Gupta},
journal= {arXiv preprint arXiv:2505.21863},
year = {2025}
}