中文

Structure-BiEval:基于自监督双轨框架解耦大语言模型评估中的结构与内容——面向Web信息系统

计算与语言 2026-05-18 v2 人工智能

摘要

随着大语言模型(LLM)演进成为Web基于自动代理和复杂Web信息系统的核心,其将自然语言严格转化为结构化格式的能力变得至关重要,因为这一能力是Web API调用和数据交换的关键。然而,评估Web本体数据中这种结构忠诚性 remains a 挑战:传统文本指标无法捕捉半结构化Web数据中的拓扑一致性,而手动评估成本 prohibitively 高昂。为此,我们提出Structure-BiEval,这是一个针对Web数据工程的自监督框架,用于定量、无需标注的评估。通过利用确定性中间表示(Intermediate Representations),该框架有效地将结构与内容解耦,利用内容语义准确性(Content Semantic Accuracy)和归一化树编辑距离(Normalized Tree Edit Distance)作为精确指标。我们对15个最先进的大语言模型在两种Web结构拓扑——层次数据(Web后端数据载荷)和表格数据(Web前端展示)—中进行了实证基准测试。结果揭示了结构性能的显著差异,包括中等规模模型在Web数据格式化方面意外地超越了更大规模模型。此外,我们的发现表明,深层递归嵌套在不同参数规模的Web代理中始终是一个挑战。

关键词

引用

@article{arxiv.2601.19923,
  title  = {Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems},
  author = {Boxiang Zhao and Qince Li and Zhonghao Wang and Zelin Cao and Yi Wang and Peng Cheng and Bo Lin},
  journal= {arXiv preprint arXiv:2601.19923},
  year   = {2026}
}