中文

AssurAI:构建韩国社会文化数据集以发现生成式AI潜在风险的实践经验

人工智能 2025-11-27 v1 计算机与社会 机器学习

摘要

生成式AI的快速演化 necessitates robust safety evaluations.然而,当前的安全数据集主要以英语为中心,无法捕捉非英语、如韩语等特定社会文化语境中的特定风险,且常限于文本模式。为弥合这一差距,我们介绍AssurAI,一个用于评估生成式AI安全的大型韩文多模态数据集。首先,我们通过来自多学科专家小组的框架,定义了35个不同的AI风险因素,以覆盖普遍的伤害以及与韩国社会文化背景的相关性。其次,依据该分类学,我们构建并发布AssurAI,包含11,480个跨文本、图像、视频和音频的实例。再者,我们应用严格的质量控制程序确保数据完整性,特点包括专家主导的种子化和众包规模化、三个独立标注以及迭代专家红队测试循环。我们的 pilot 研究验证了AssurAI在评估最新LLM安全性方面的有效性。我们将AssurAI向公众发布,以促进更安全、更可靠的生成式AI系统的开发,服务于韩国社区。

关键词

引用

@article{arxiv.2511.20686,
  title  = {AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI},
  author = {Chae-Gyun Lim and Seung-Ho Han and EunYoung Byun and Jeongyun Han and Soohyun Cho and Eojin Joo and Heehyeon Kim and Sieun Kim and Juhoon Lee and Hyunsoo Lee and Dongkun Lee and Jonghwan Hyeon and Yechan Hwang and Young-Jun Lee and Kyeongryul Lee and Minhyeong An and Hyunjun Ahn and Jeongwoo Son and Junho Park and Donggyu Yoon and Taehyung Kim and Jeemin Kim and Dasom Choi and Kwangyoung Lee and Hyunseung Lim and Yeohyun Jung and Jongok Hong and Sooyohn Nam and Joonyoung Park and Sungmin Na and Yubin Choi and Jeanne Choi and Yoojin Hong and Sueun Jang and Youngseok Seo and Somin Park and Seoungung Jo and Wonhye Chae and Yeeun Jo and Eunyoung Kim and Joyce Jiyoung Whang and HwaJung Hong and Joseph Seering and Uichin Lee and Juho Kim and Sunna Choi and Seokyeon Ko and Taeho Kim and Kyunghoon Kim and Myungsik Ha and So Jung Lee and Jemin Hwang and JoonHo Kwak and Ho-Jin Choi},
  journal= {arXiv preprint arXiv:2511.20686},
  year   = {2025}
}

备注

16 pages, HuggingFace: https://huggingface.co/datasets/TTA01/AssurAI