JanusCoder:面向代码智能的基础性视觉-程序化界面
人工智能
2026-05-21 v3 计算与语言
计算机视觉与模式识别
软件工程
摘要
神经代码智能的应用范围正在快速扩展,超越基于文本的源代码,涵盖程序生成的丰富视觉输出。这种视觉维度对灵活的内容生成和精确的、以程序为导向的可视化编辑至关重要。然而,由于合成和质量评估方面的挑战,高质量多模态代码数据的稀缺已阻碍了进展。为应对这些挑战,我们从数据和建模两个层面做出贡献。首先,我们引入一个完整的合成工具包,利用数据模态之间的相互协同作用,高效地生产一个大规模、高质量的语料库,涵盖从标准图表到复杂的交互式网页界面以及代码驱动的动画。基于这个工具包,我们构建了 JanusCode-800K,这是目前规模最大的多模态代码语料库。这驱动着我们模型的训练,包括 JanusCoder 和 JanusCoderV,这些模型为从文本指令、视觉输入或两者的组合生成代码提供了视觉-程序化界面。我们的统一模型与现有方法不同,后者为孤立任务构建专用模型。大量实验表明,JanusCoder 系列模型在文本导向和视觉导向编码任务上性能卓越,规模为 7B 到 14B的模型接近或甚至超过了商业模型。此外,广泛的分析提供了将程序逻辑与其视觉表达和谐共的关键见解。我们的代码和检查点可在 https://github.com/InternLM/JanusCoder 上获得。
引用
@article{arxiv.2510.23538,
title = {JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence},
author = {Qiushi Sun and Jingyang Gong and Yang Liu and Qiaosheng Chen and Lei Li and Kai Chen and Qipeng Guo and Ben Kao and Fei Yuan},
journal= {arXiv preprint arXiv:2510.23538},
year = {2026}
}
备注
ICLR 2026 Camera Ready Version, with code and data available