中文

FronTalk:基于多模态反馈的前端开发对话式代码生成基准

计算与语言 2026-01-09 v1 计算机视觉与模式识别 机器学习 软件工程

摘要

我们提出 FronTalk,一个用于前端代码生成的基准测试,开创性地研究了一种独特的交互模式:基于多模态反馈的对话式代码生成。在前端开发中,手绘草图、原型图和标注截图等视觉元素对于传递设计意图至关重要,但其在多轮代码生成中的作用尚未得到广泛探索。为此,我们聚焦于前端开发任务,构建 FronTalk,收录 100 组来自新闻、金融、艺术等多样领域的真实网站的多轮对话。每一轮包含文本指令和等效视觉指令,分别代表相同的用户意图。为全面评估模型性能,我们提出一种新型基于智能体的评估框架,利用网页智能体模拟用户并浏览网站,从而衡量功能正确性和用户体验。对 20 个模型的评估揭示了两个在文献中系统性研究不足的关键挑战:(1) 模型存在显著的遗忘问题,即模型会覆盖之前实现的功能,导致任务失败;(2) 在解释视觉反馈方面存在持续挑战,尤其是针对开源视觉语言模型 (VLM)。我们提出了一种强基准方法以解决遗忘问题,采用 AceCoder 方法,通过自主网页智能体批判性地审查每一条过去指令的实现,从而将遗忘率大幅降低至接近零,并将性能提升至最高 9.3%(从 56.0% 提升至 65.3%)。总体而言,我们旨在为前端开发及更广泛的多轮、多模态代码生成交互动力学提供坚实基础。代码和数据已发布于 https://github.com/shirley-wu/frontalk

关键词

引用

@article{arxiv.2601.04203,
  title  = {FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback},
  author = {Xueqing Wu and Zihan Xue and Da Yin and Shuyan Zhou and Kai-Wei Chang and Nanyun Peng and Yeming Wen},
  journal= {arXiv preprint arXiv:2601.04203},
  year   = {2026}
}