利用众包识别对消费者重要的条款与条件
人机交互
2021-12-01 v2
摘要
条款与条件(T&Cs)在网页上无处不在,常包含对消费者重要的信息,却鲜被阅读。先前研究探索了利用人工标注者、自然语言处理和深度学习技术来揭示警示性隐私策略的方法。然而,这些前期工作使用预先确定的标注类别,并未从消费者自身视角调查其真正认为重要的内容。本文中,我们转而将众包与T&Cs中“何为重要”的开放性定义相结合。我们提出一种由两两比较、一致性验证和Bradley-Terry排名建模组成的工作流,以基于该开放性定义有效建立来自非专家众包工人的T&C语句排名,并进一步分析消费者偏好。我们将此工作流应用于来自27个电商网站的1,551条T&C语句,由3,462名独特众包工人完成203,068次两两比较,并对被认为重要/不重要的语句进行主题与可读性分析。我们发现消费者尤其关注与售后和金钱相关的政策,并倾向于将更难理解的语句视为更重要。我们还提出机器学习模型来识别消费者认为重要的T&C条款,最佳取得92.7%平衡准确率、91.6%召回率和89.2%精确率。我们预见利用我们的工作流与模型可大规模高效可靠地高亮网站上的重要T&Cs,提升消费者意识。
引用
@article{arxiv.2111.12182,
title = {Identifying Terms and Conditions Important to Consumers using Crowdsourcing},
author = {Xingyu Liu and Annabel Sun and Jason I. Hong},
journal= {arXiv preprint arXiv:2111.12182},
year = {2021}
}