通过详细宪法定义和AI驱动评估提高标签一致性
信号处理
2026-05-26 v1
摘要
许多自动化标注管道将输入分类到由书面规范定义的类别中,其中内容 moderation是其中突出的用例。简单的类别定义不够详细,以至于标注员无法产生这些管道所需的准确、一致的金标标签。一个解决方案是编写足够详尽的规定性定义,以覆盖足够多的真实边界案例,以至于标注员无法与书面解释产生分歧。实际中,这种程度的定义超过了人类标注员在工作记忆中能保持的范围,因此标注员会退回到直觉中,标签与书面规则产生偏移,导致准确性和一致性下降。我们提出并展示了一种AI驱动的工作流程,其中AI帮助为每个类别撰写一部宪法,以充分覆盖边缘情况,使AI在每个输入上对其进行解释,以比仅读同一文件的人类更一致和准确地产生金标标签。我们在三个内容moderation类别(骚扰、仇恨言论、非暴力犯罪)上进行评估,表明该方法将跨模型不一致性降低最高可达57倍,跨模型不一致可用于诊断规格差距,由负责高层次决定每个类别应意义的人而非单个标注调用。对于安全评估,我们引入了双轴表述,对整个对话在意图和内容上独立评分,以便下游消费者可以根据需要或两者。
引用
@article{arxiv.2605.24246,
title = {Feasibility Study of VLC-Based Collective Perception for Vehicular Communication},
author = {Kosuke Nakano and Shan Lu and Takaya Yamazato},
journal= {arXiv preprint arXiv:2605.24246},
year = {2026}
}
备注
6 pages, 7 figures