中文

IGenBench:文本到信息图生成的可靠性基准测试

机器学习 2026-01-09 v1 计算机视觉与模式识别

摘要

信息图是一种复合视觉制品,它将数据可视化与文本和插图元素结合在一起以传达信息。虽然最近的文本到图像 (T2I) 模型可以生成具有美学吸引力的图像,但它们生成信息图的可靠性仍不清楚。生成的信息图乍看之下可能是正确的,但包含容易被忽视的问题,例如扭曲的数据编码或不正确的文本内容。我们提出了 IGENBENCH,这是第一个用于评估文本到信息图生成可靠性的基准,包含 600 个精选测试用例,涵盖 30 种信息图类型。我们设计了一个自动化评估框架,该框架基于 10 种问题类型的分类法,将可靠性验证分解为原子化的“是/否”问题。我们采用多模态大语言模型 (MLLM) 来验证每个问题,得出问题级准确率 (Q-ACC) 和信息图级准确率 (I-ACC)。我们在 IGENBENCH 上全面评估了 10 个 SOTA T2I 模型。我们的系统分析揭示了未来模型开发的关键见解: 性能呈现三层级结构,表现最好的模型 Q-ACC 达到 0.90,但 I-ACC 仅为 0.49; 与数据相关的维度成为普遍瓶颈(例如,数据完整性:0.21); 在所有模型中实现端到端正确性面临挑战。我们在 https://igen-bench.vercel.app/ 上发布了 IGENBENCH。

关键词

引用

@article{arxiv.2601.04498,
  title  = {IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation},
  author = {Yinghao Tang and Xueding Liu and Boyuan Zhang and Tingfeng Lan and Yupeng Xie and Jiale Lao and Yiyao Wang and Haoxuan Li and Tingting Gao and Bo Pan and Luoxuan Weng and Xiuqi Huang and Minfeng Zhu and Yingchaojie Feng and Yuyu Luo and Wei Chen},
  journal= {arXiv preprint arXiv:2601.04498},
  year   = {2026}
}