中文

LLM Data Auditor:评估合成数据质量与可信度的度量导向调查

机器学习 2026-01-27 v1

摘要

大型语言模型(LLMs)已成为生成跨多模态数据的强大工具。通过将数据从稀缺资源转化为可控资产,LLMs缓解了实验室数据获取成本对模型训练、评估和系统迭代的瓶颈。然而,确保LLM生成的合成数据具有高质量仍是一个关键挑战。现有研究主要关注生成方法,很少直接关注最终数据质量。此外,大多数研究局限于单一模态,缺乏跨不同数据类型的统一视角。为填补这一差距,我们提出了LLM Data Auditor框架。在该框架中,我们首先描述了LLMs用于生成六种不同模态数据的方法。更重要的是,我们系统地将合成数据的内在度量从两个维度进行分类:质量和可信度。这一方法将关注点从依赖下游任务性能的外在评估,转向数据本身的内在属性。使用该评估系统,我们分析了代表性生成方法在每个模态上的实验评估,发现当前评估实践存在显著不足。基于这些发现,我们提出了具体建议,以提高社区数据生成评估的水平。最后,该框架概述了在不同模态下应用合成数据的实用方法。

关键词

引用

@article{arxiv.2601.17716,
  title  = {Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games},
  author = {Daniel M. Pedrozo and Telma W. de L. Soares and Bryan L. M. de Oliveira},
  journal= {arXiv preprint arXiv:2601.17716},
  year   = {2026}
}

备注

Presented at the NeusymBridge Workshop at AAAI 2026