中文

DRACO:面向深层研究准确性、完整性和客观性的跨域基准

机器学习 2026-02-13 v1 人工智能

摘要

我们提出 DRACO (Deep Research Accuracy, Completeness, and Objectivity),一个复杂深层研究任务的基准。这些任务跨越 10 个领域,涉及来自 40 个国家的信息源,源自来自大规模深层研究系统中实际使用模式的匿名化数据。任务从去标识化的 Perplexity Deep Research 请求数据集中抽取,然后经过筛选和增强,以确保任务匿名化、开放式且复杂、客观可评估,并代表实际深层研究用例的广泛范围。输出将根据特定于任务的评分标准,对四个维度进行评分:事实准确性 (准确性)、分析深度和广度(包括完整性)、呈现质量(包括客观性)以及引用质量。DRACO 已在 https://hf.co/datasets/perplexity-ai/draco 上公开。

关键词

引用

@article{arxiv.2602.11685,
  title  = {DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity},
  author = {Joey Zhong and Hao Zhang and Clare Southern and Jeremy Yang and Thomas Wang and Kate Jung and Shu Zhang and Denis Yarats and Johnny Ho and Jerry Ma},
  journal= {arXiv preprint arXiv:2602.11685},
  year   = {2026}
}