中文

NEWSAGENT:用于新闻写作的多模态智能体基准测试

人工智能 2025-09-03 v1

摘要

近期工业界的自主数字智能体(如Manus AI和Gemini research mode)的进展凸显了通过自主决策和任务分解实现结构化任务的潜力;然而,智能体系统在提升多模态Web数据生产力方面能达到何种程度尚不清晰。我们在新闻领域进行研究,该领域需要从多模态原始内容中进行迭代式规划、解释和情境推理,以形成结构化的新闻稿件。我们引入NEWSAGENT,用于评估智能体如何自动搜索可用原始内容、选择所需信息并加以编辑和重述以形成新闻稿件的基准测试。给定写作指令和第一手数据作为新闻稿草稿的起始点,智能体被要求识别叙事视角、issue关键词查询、检索历史背景并生成完整文章。不同于典型的摘要或检索任务,关键上下文并非直接可用,而需主动发现,这反映了现实新闻写作中信息差的情况。NEWSAGENT包含6000个经人工验证的示例,来自真实新闻,多模态内容已转换为文本以实现广泛模型兼容性。我们对开源和闭源LLMs使用常用智能体框架在NEWSAGENT上进行评估,结果显示智能体能够检索相关事实,但在规划和叙事整合方面存在挑战。我们认为NEWSAGENT为迭代和评估智能体在多模态Web数据操作中实现现实生产力提供了可靠测试平台。

关键词

引用

@article{arxiv.2509.00446,
  title  = {NEWSAGENT: Benchmarking Multimodal Agents as Journalists with Real-World Newswriting Tasks},
  author = {Yen-Che Chien and Kuang-Da Wang and Wei-Yao Wang and Wen-Chih Peng},
  journal= {arXiv preprint arXiv:2509.00446},
  year   = {2025}
}

备注

Preprint