利用 ML 辅助抽样和 LLM 标注测量违规内容的普遍程度
机器学习
2026-02-24 v1 统计方法学
机器学习
摘要
内容安全团队需要反映用户实际体验的指标,而不仅仅是用户报告的情况。我们研究了普遍程度:即在给定日子中,用户所看内容中违反特定政策的内容所占的比例。由于违规内容往往罕见且人工标注成本高昂,导致频繁且具代表性的调查变得缓慢。我们提出一种基于设计的测量系统,该系统(i)利用 ML 辅助加权从展示流中抽取每日概率样本,以集中高曝光和高风险内容的标注预算,同时保持无偏性;(ii)使用受政策提示控制并经过金标准验证的多模态 LLM 对抽样项目进行标注;(iii)产生设计一致的普遍程度估计值,包含置信区间和仪表盘下钻分析。一个关键设计目标是具备多重切入点的全局样本:同一每日样本支持按展示来源、观众地理位置、内容年龄及其他分段进行普遍程度估计。我们描述了统计估计器、方差与置信区间构建、标签质量监控,以及使系统在不同政策间可配置的工程工作流程。
引用
@article{arxiv.2602.18518,
title = {Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling},
author = {Attila Dobi and Aravindh Manickavasagam and Benjamin Thompson and Xiaohan Yang and Faisal Farooq},
journal= {arXiv preprint arXiv:2602.18518},
year = {2026}
}
备注
8 pages