中文

从语音到数据:解密谷歌如何利用语音数据进行用户画像构建

人机交互 2024-03-12 v1

摘要

智能家居语音助手使用户能够便捷地与物联网设备交互并执行 Internet 搜索;然而,它们也收集可能携带用户敏感个人信息的语音输入。以往研究考察了从用户语音指令内容推断得到的信息如何被用于跟踪和广告目的。本文系统评估了语音本身如何被用于用户画像构建的谷歌生态系统。为此,我们通过与特定类别网站互动来模拟各种用户画像。随后,我们使用中性语音指令(我们定义为不透露个人兴趣且无需调用 Google 智能扬声器搜索 API 的语音指令),与这些扬声器互动。我们也探讨了非中性语音指令对用户画像构建的影响。值得注意的是,我们采用通常不会匹配预定义画像的语音。随后,我们根据画像变化的观察不断改进实验,以更好地模拟现实世界中用户与智能扬声器的交互方式。我们发现谷歌利用这些语音录音进行用户画像构建,在某些情况下,收集语音指令后,可更改 Google 用于定制广告的 5 个类别中的全部 8 个类别报告的类别。

关键词

引用

@article{arxiv.2403.05586,
  title  = {From Speech to Data: Unraveling Google's Use of Voice Data for User Profiling},
  author = {Xinhang Ma and Sirui Chen},
  journal= {arXiv preprint arXiv:2403.05586},
  year   = {2024}
}

备注

11 pages, 1 figure, 7 tables