CAGE:通过代码锚定生成式增强桥接教育图表的准确性与美学性之间的差距
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
教育图表——生物过程、化学结构、物理系统和数学概念的标注插图——是 K-12 教学中必不可少的认知工具。然而,现有方法无法同时保证准确性和生动性。开源扩散模型产生视觉丰富的图像但会严重错误地破坏文本标签。基于代码的生成方法通过 LLM 保证标签正确性但产生视觉平坦的输出。闭源 API 在一定程度上弥合了这一差距,但在教育规模下不可靠且昂贵。我们在400个 K-12 图表提示上量化了这一准确性-美学困境,通过互补的自动化和人类评估协议衡量标签忠实度和视觉质量。为解决这一问题,我们提出CAGE(Code-Anchored Generative Enhancement):LLM综合生成产生结构正确图表的可执行代码,然后通过ControlNet 将程序化输出条件化给扩散模型,以实现视觉精炼的图形,同时保持标签忠实度。我们还引入EduDiagram-2K,包含2000对程序化-风格化图表以支持此管道,并展示概念验证结果及面向多媒体社区的研究议程。
引用
@article{arxiv.2604.09691,
title = {CAGE: Bridging the Accuracy-Aesthetics Gap in Educational Diagrams via Code-Anchored Generative Enhancement},
author = {Dikshant Kukreja and Kshitij Sah and Karan Goyal and Mukesh Mohania and Vikram Goyal},
journal= {arXiv preprint arXiv:2604.09691},
year = {2026}
}