窃取创作者工作流程:基于创作者启发的智能体框架及迭代反馈循环提升科学短视频生成
计算与语言
2025-04-29 v1 人工智能
机器学习
摘要
从科学论文生成引人注目的、准确的短视频内容具有挑战性,主要源于内容的复杂性以及专家作者与读者之间的鸿沟。现有端到端方法常因事实错误和视觉伪影而受限,致使其在科学传播方面的实用性受到制约。为此,我们提出 SciTalk——一种新型多 LLM 智能体框架,依托文本、图 figure、视觉风格和头像等多种数据源构建视频内容。灵感来自内容创作者的工作流程,SciTalk 使用专门的智能体进行内容概述、视觉场景规划以及文本与布局编辑,并引入迭代反馈机制,使视频生成智能体模拟用户角色,对前一轮生成的视频提供反馈并优化生成提示。实验评估表明,SciTalk 在科学内容准确性和吸引力方面,优于简单提示方法,尤其在视频生成的迭代优化循环中表现更佳。尽管初步结果尚未达到人类创作者的水平,但我们的框架为反馈驱动的视频生成提供了宝贵的洞见,揭示了其面临的挑战与收益。我们的代码、数据及生成视频将公开提供。
引用
@article{arxiv.2504.18805,
title = {Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation},
author = {Jong Inn Park and Maanas Taneja and Qianwen Wang and Dongyeop Kang},
journal= {arXiv preprint arXiv:2504.18805},
year = {2025}
}
备注
Project page: https://minnesotanlp.github.io/scitalk-project-page/