中文

DICES 数据集:面向安全性的对话式 AI 评估中的多样性

人机交互 2023-06-21 v1

摘要

机器学习方法通常需要具有正例与负例清晰分离的训练和评估数据集。这有可能简化甚至掩盖许多任务中固有的主观性。在数据中保留此类内容差异与多样性往往昂贵且费力。在构建对话式 AI 系统的安全性数据集时,这一点尤其令人担忧,因为安全性兼具社会性与文化性嵌入。为展示对话式 AI 安全这一关键方面,并便利深入的模型性能分析,我们引入 DICES(Diversity In Conversational AI Evaluation for Safety,对话式 AI 安全评估中的多样性)数据集,其包含关于评分者的细粒度人口统计信息、每项的评分高重复以确保分析的统计效力,并将评分者投票编码为跨不同人口统计的分布以允许对不同的聚合策略进行深入探究。简言之,DICES 数据集使得在对话式 AI 安全语境中观察与度量方差、模糊性与多样性成为可能。我们还阐释该数据集如何为建立指标提供基础,以展示评分者评分如何与种族/民族群体、年龄组和性别等人口统计类别相交。DICES 的目标是作为共享资源与基准,在对话式 AI 系统安全评估中尊重多元视角。

关键词

引用

@article{arxiv.2306.11247,
  title  = {DICES Dataset: Diversity in Conversational AI Evaluation for Safety},
  author = {Lora Aroyo and Alex S. Taylor and Mark Diaz and Christopher M. Homan and Alicia Parrish and Greg Serapio-Garcia and Vinodkumar Prabhakaran and Ding Wang},
  journal= {arXiv preprint arXiv:2306.11247},
  year   = {2023}
}