用于在线校准的Bandits算法:社交媒体平台内容审核中的应用
机器学习
2022-11-15 v1
摘要
我们介绍Meta当前用于从其平台移除违规内容的内容审核策略。Meta依赖手工构建与习得的风险模型来标记潜在违规内容以供人工审核。我们的方法将这些风险模型聚合为单一排序分数,并对它们进行校准以优先采用更可靠的风险模型。一个关键挑战是违规趋势随时间变化,影响哪些风险模型最为可靠。我们的系统还应对诸如风险模型变更与新风险模型出现等生产挑战。我们使用上下文bandit(contextual bandit)根据此类趋势更新校准。我们的方法使Meta衡量其内容审核策略有效性的顶层指标提升了13%。
引用
@article{arxiv.2211.06516,
title = {Bandits for Online Calibration: An Application to Content Moderation on Social Media Platforms},
author = {Vashist Avadhanula and Omar Abdul Baki and Hamsa Bastani and Osbert Bastani and Caner Gocmen and Daniel Haimovich and Darren Hwang and Dima Karamshuk and Thomas Leeper and Jiayuan Ma and Gregory Macnamara and Jake Mullett and Christopher Palow and Sung Park and Varun S Rajagopal and Kevin Schaeffer and Parikshit Shah and Deeksha Sinha and Nicolas Stier-Moses and Peng Xu},
journal= {arXiv preprint arXiv:2211.06516},
year = {2022}
}