中文

单文件测试:首次输出 LLM Web 生成与社交触达追踪的纵向公共接口评估

软件工程 2026-05-11 v1 人工智能

摘要

本文对 2025 年 12 月 10 日至 2026 年 2 月 4 日期间在“HTML AI Battle”项目的 17 项公开实验中收集的 68 个单文件 HTML 生成结果进行了为期八周的观察比较。在固定的公共接口协议下,对 GPT、Gemini、Grok 和 Claude 四个推理模型族进行了比较,未使用自定义指令、个性化调优或修复提示。每个输出均通过渲染的浏览器视频进行评估,结合人工评分和作为评判者的 Gemini LLM 层,对提示词遵循度、功能正确性和 UI 质量进行打分,随后打包成涵盖 X (Twitter)、TikTok 和 YouTube 的标准化社交媒体协议。该追踪器还用于两项有监督预测分析:针对 24 小时 X 展示量的实验级模型,以及针对 HTML 冗长度的生成级模型。在该协议下,Claude 是最强且最一致的模型族,其平均表现领先,并在主要人工加权评分下赢得了 9/17 个提示词。总体而言,较长的测量推理时间与更高的质量无关。作为评判者的 Gemini 在功能正确性和整体表现上比人工评估者明显更宽容,而稳定的自我偏好偏差仍未解决。探索性的 X 展示量模型在筛选后交叉验证下表现仍然较弱(MAE = 46,874, R^2 = -0.377),而 HTML 行数模型表现更好,其中仅模型族基线优于感知提示词的替代方案(MAE = 135.2, R^2 = 0.576)。总体而言,所选的发布前技术/音频变量不足以预测 24 小时 X 触达量,而代码冗长度受模型族的影响远大于受提示词措辞的影响。上述比较仍属观察性质,并受到公共接口漂移、访问路径差异以及单一主要人工评分者的限制。

关键词

引用

@article{arxiv.2605.06707,
  title  = {The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking},
  author = {Diego Cabezas Palacios},
  journal= {arXiv preprint arXiv:2605.06707},
  year   = {2026}
}

备注

23 pages, 3 figures, 5 tables