WikiAutoGen:面向多模态维基百科式文章生成
计算机视觉与模式识别
2025-09-08 v3
摘要
知识发现与收集是需要大量人力才能确保高质量输出的智力密集型任务。近期研究探索了多主体框架用于自动化维基百科式文章生成,通过检索和综合互联网信息。然而,这些方法主要关注文本-only生成,忽视了在信息丰富性和参与度方面发挥作用的多模态内容的重要性。本文我们介绍WikiAutoGen,一个用于自动化多模态维基百科式文章生成的新系统。不同于先前方法,WikiAutoGen 检索并整合相关图像与文本,丰富了生成内容的深度和视觉吸引力。为进一步提高事实准确性和全面性,我们提出了一种多视角自省机制,对检索内容从不同视角进行批判性评估,以增强可靠性、广度和连贯性等。此外,我们引入WikiSeek,一个由维基百科文章主题配对的文本和图像表示组成的基准,用于评估更具挑战性主题上的多模态知识生成。实验结果显示,WikiAutoGen 在我们的WikiSeek基准上比以前的方法高出8%-29%,产生更准确、更连贯且更具视觉丰富性的维基百科式文章。我们的代码和示例可在 https://wikiautogen.github.io/ 获取。
引用
@article{arxiv.2503.19065,
title = {WikiAutoGen: Towards Multi-Modal Wikipedia-Style Article Generation},
author = {Zhongyu Yang and Jun Chen and Dannong Xu and Junjie Fei and Xiaoqian Shen and Liangbing Zhao and Chun-Mei Feng and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2503.19065},
year = {2025}
}
备注
ICCV 2025, Project in https://wikiautogen.github.io/