RiOSWorld:多模态计算机使用代理的风险基准评估
人工智能
2025-06-23 v3
摘要
随着多模态大语言模型(MLLMs)的快速发展,它们越来越多地被部署为能够完成复杂计算机任务的自主计算机使用代理。然而,一个紧迫的问题出现了:为对话场景中的一般MLLMs设计并对其齐的安全风险原则,能否有效迁移到真实的计算机使用场景中?现有关于评估基于MLLM的计算机使用代理安全风险的研究存在若干局限性:要么缺乏真实的交互环境,要么狭隘地关注一种或少数几种特定风险类型。这些局限性忽略了真实环境的复杂性、可变性和多样性,从而限制了对计算机使用代理的全面风险评估。为此,我们引入了\textbf{RiOSWorld},这是一个旨在评估基于MLLM的代理在真实计算机操作过程中潜在风险的基准。我们的基准包含492个风险任务,涵盖各种计算机应用,涉及网络、社交媒体、多媒体、操作系统、电子邮件和办公软件。我们根据风险来源将这些风险分为两大类:(i)用户来源风险和(ii)环境风险。在评估方面,我们从两个角度评估安全风险:(i)风险目标意图和(ii)风险目标完成度。在\textbf{RiOSWorld}上对多模态代理进行的大量实验表明,当前的计算机使用代理在真实场景中面临显著的安全风险。我们的发现突出了真实计算机操作中计算机使用代理安全对齐的必要性和紧迫性,为开发可信的计算机使用代理提供了有价值的见解。我们的基准已在 https://yjyddq.github.io/RiOSWorld.github.io/ 公开。
引用
@article{arxiv.2506.00618,
title = {RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents},
author = {Jingyi Yang and Shuai Shao and Dongrui Liu and Jing Shao},
journal= {arXiv preprint arXiv:2506.00618},
year = {2025}
}
备注
40 pages, 6 figures, Project Page: https://yjyddq.github.io/RiOSWorld.github.io/