AgentEval:生成式代理作为AI生成内容人工评估的可靠替代
人工智能
2025-12-10 v1
摘要
现代企业日益面临生成和评估高质量内容所需的时间和成本挑战。人类作者面临时间限制,外部评估可能成本高昂。虽然大型语言模型(LLMs)在内容创作方面具有潜力,但AI生成内容的质量问题仍然存在。传统的评估方法如人工调查进一步增加了运营成本,凸显了对高效自动化解决方案的需求。本研究引入生成式代理来应对这些挑战。这些代理能够快速且低成本地评估AI生成内容,通过评分连贯性、趣味性、清晰度、公平性和相关性等方面来模拟人类判断。通过纳入这些代理,企业可以简化内容生成流程,确保一致的高质量输出,同时减少对昂贵人工评估的依赖。该研究为提升LLM生成符合业务需求的高质量内容提供了关键见解,在自动化内容生成与评估方面取得了重大进展。
引用
@article{arxiv.2512.08273,
title = {AgentEval: Generative Agents as Reliable Proxies for Human Evaluation of AI-Generated Content},
author = {Thanh Vu and Richi Nayak and Thiru Balasubramaniam},
journal= {arXiv preprint arXiv:2512.08273},
year = {2025}
}
备注
10 pages, 5 figures