中文

将写作作为开放式智能体的测试平台

计算与语言 2025-03-26 v1 人工智能 人机交互

摘要

开放式任务对 LLM 而言尤为具有挑战性,因为其解空间庞大,要求广泛的探索和灵活的策略,尤其是在成功缺乏明确客观定义时。写作凭借其庞大的解空间和主观评价标准,为研究此类问题提供了极具吸引力的测试平台。本文探讨了 LLM 作为协作合著者的潜力,使其能够自主提出并实施文本改进。我们分析了三个主流 LLM——Gemini 1.5 Pro、Claude 3.5 Sonnet 和 GPT-4o,重点关注其动作多样性、人类对齐性以及迭代改进能力如何影响整体性能。本研究建立了一个用于基准测试自主写作智能体的框架,并更广泛地强调了在多样化开放式领域中构建卓越系统所面临的基本挑战与潜在解决方案。

关键词

引用

@article{arxiv.2503.19711,
  title  = {Writing as a testbed for open ended agents},
  author = {Sian Gooding and Lucia Lopez-Rivilla and Edward Grefenstette},
  journal= {arXiv preprint arXiv:2503.19711},
  year   = {2025}
}