$Q_{bias}$——关于搜索查询与查询建议中媒体偏见的数据集
信息检索
2023-11-30 v1
摘要
本出版物描述了的动机与生成过程,该数据集包含Google和Bing的搜索查询、一个用于抓取偏见新闻文章的工具与数据集,以及用于研究在线搜索中偏见的语言模型。网络搜索引擎是信息检索中的主要因素与可信来源,尤其在政治领域。然而,偏见信息会影响意见形成并导致偏见性观点。为与搜索引擎交互,用户撰写搜索查询并与搜索引擎提供的搜索查询建议交互。缺乏关于搜索查询的数据集阻碍了该主题的研究。我们使用评估基于transformer的语言模型的不同微调方法,旨在产生能够以左、右政治立场使文本带有偏见的模型。除本工作外,我们还提供了用于文本偏见化的数据集与语言模型,以支持对在线信息搜索中偏见的进一步研究。
引用
@article{arxiv.2311.17780,
title = {$Q_{bias}$ -- A Dataset on Media Bias in Search Queries and Query Suggestions},
author = {Fabian Haak and Philipp Schaer},
journal= {arXiv preprint arXiv:2311.17780},
year = {2023}
}
备注
Paper accepted at ACM Web Science Conference 2023. 6 pages