谷歌发布了名为 Google Dataset Search(测试版)的产品,目的是让用户更容易找到想要的数据集,谷歌表示其宗旨就是“Making it easier to discover datasets”。本文将介绍发展 Google Dataset Search 的背景及它的体验,当然,目前该产品还处在测试版本中,很多数据及功能还不够完善。
背景 当下,许多学科的科学家和越来越多的写手需要与数据打交道,网上有成千上万的数据存储库,可以访问数百万个数据集,同时世界各个国家与地区政府也在网上公布他们的数据。谷歌表示,Dataset Search 的初衷正是为了能够让人们更加轻松地访问这些数据。 此次发布的 Dataset Search 其实也是 Google 将数据集更进一步纳入产品中的一系列举措之一,上个月我们报导过 Google 该系列举措的另一项,也就是 Google 与 30 位顶级数据记者合作,希望找到以表格形式改进信息呈现的方法,最终在通力合作之下,他们确定了在搜索返回结果中直接直观显示数据表格的方法,使用户更容易找到他们想要的信息。
Google Dataset Search工作方式 Google 介绍,Dataset Search 的工作方式与 Google Scholar 类似,首先需要数据集提供者使用 schema.org 标准来描述其数据集,当用户在 Dataset Search 上搜索时,它将在任何托管位置查找相应数据集,包括发布者的网站、数字图书馆与作者的个人网页等。 关于如何将数据集录入 Dataset Search,Google 解释,“基于描述数据集信息的开放标准 schema.org,我们为数据集提供商制定了指南,以 Google(和其它搜索引擎)可以更好地理解页面内容的方式描述其数据。这些指南包括有关数据集的重要信息:数据集创建者、发布时间、数据收集方式、使用数据的条款等。然后我们收集并链接此信息,分析其中同一数据集的不同版本可能在哪里,并找到可能描述或讨论数据集的出版物。”
Google Dataset Search(测试版)体验报告 目前 Dataset Search 还属于 beta 版,而且刚刚起步,收录的数据集还不够多,但是按耐不住搜了一下“开源中国”,返回如下图:
又搜了一下“码云”,返回结果同上,没有什么结果,等完善了再来试试。 然后再搜了一下 Linux 创始人 “Linus Torvalds”,发现还真有结果,而且返回的是让人哭笑不得的内容:
搜索结果是一个来自 data.world 的数据集,“Linus Torvalds Rants”是“Linus Torvalds 发飙”的意思,嗯,这很 Linus。 兴奋地点进去(嗯?为什么我要兴奋),果然发现了宝藏:
原来这个数据集收集了 Linus 从 2012 年到 2015 年间在邮件列表上发过的飙。这里顺便提一下 2018 年 6 月份 Linus 也发了一次大飙:有时候标准就是错误的,详情请看 Linux创始人Linus又开怼:有时候标准完全就是错误的。 按照指示,把该“Linus 发飙合集”在工作区打开后是下边这样的,大概感受一下:
试了一下,数据集中的条目确实可以访问到原始邮件,佩服 Linus 的高产,也为 Dataset Search 点赞,真的太方便了。如果哪天想以 Linus 的发怒为基线来写一个 Linux 内核的发展历程,那这样的搜索神器就帮大忙了。
总结 如果 Google Dataset Search 能够把数据做完善,这将非常方便用户,能更快的找到所需的数据,但是对于刚起步的产品,还需要花费时间。
相关主题 |