文档介绍:需求高涨的数据科学家从技术方面来看,硬盘价格下降,NoSQL数据库等技术的出现,使得和过去相比,大量数据能够以廉价高效的方式进行存储。此外,像Hadoop这样能够在通用性服务器上丁•作的分布式处理技术的出现,也使得对庞人的非结构化数据进行统计处理的工作比以往更快速且更廉价。然而,就算所拥有的工具再完美,它木少是不可能让数据产生价值的。接下来我们还需要能够运用这些工具的人才,他们能够从堆积如山的大量数据屮找到金矿,并将数据的价值以易懂的形式传达给决策者,最终得以在业务上实现。具备这些技能的人才,就是在大数据浪潮如火如荼的美国目前正千金难求的“数据科学家S对数据科学家的关注,源丁•大家逐步认识到,Google、AmazonFacebook等公司成功的背后,存在着这样的一批专业人才。这些Web公司对于大量数据不仅仅是进行存储而已,而是将其变为有价值的金矿——例如,搜索结果、定向广告、准确的商品推荐、可能认识的好友列表等。数据科学(datascience)是一个很久Z前就存在的词汇,但数据科学家(datascientist)却是儿年前突然出现的一个新词。关于这个词的起源说法不一,其屮在《数据Z美XBeautifulData,TobySegaran^JeffHammerbacher编著,O'Reilly出版)一书中,对于Facebook的数据科学家,有如下叙述。“在Facebook,我们发现传统的头衔如商业分析师、统计学家、工程师和研究科学家都不能确切地定义我们团队的角色。该角色的工作是变化多样的:在任意给定的-吠,团队的一个成员可以用Python实现一个多阶段的处理管道流、设计假设检验、用丁具R在数据样木上执行冋归测试、:为数据密集熨产品或服务设计和实现算法,或者把我们分析的结果以清晰简洁的方式展示给企业的其他成员。为了掌握完成这多方面任务需要的技术,我们创造了'数据科学家'这种角色。”仅仅在几年前,数据科学家还不是一个正式确定的职业,然而一眨眼的工夫,这个职业就己经被誉为“今后10年IT行业最重要的人才”了。Google怦席经济学家,加州大学伯克利分校教授哈尔•范里安(HalVarian,1947〜)先生,在2008年40月与麦肯锡总监JamesManyika先生的对话屮,曾经讲过卞面一段话(中文版节选H麦肯锡季刊官方屮文稿)。“我总是说,在未来10年里,最有意思的工作将是统计学家。人们都认为我在开玩笑。但是,过去谁能想到电脑工程师会成为上世纪90年代最有趣的工作?在未来10年里,获取数据——以便能理解它、处理它、从屮提取价值、使其形象化、传送它一一的能力将成为一种极其重要的技能,不仅在专业层面上是这样,而且在教冇层面(包括对中小学生、高屮生和大学生的教冇)也是如此。由于如今我们C真正拥有实质上免费的和无所不在的数据,因此,与此互补的稀缺要素是理解这些数据并从屮提取价值的能力。"范里安教授在当初的对话中使用的是“statisticians”(统计学家)…词,虽然当时他没有使用“数据科学家”这个词,但这里所指的,正是现在我们所讨论的数据科学家。数据科学家所需的技能数据科学家这一职业并没有固定的定义,但大体上指的迅这样的人才。“所谓数据科学家,是指运用统计分析、机器学习、分布式处理等技术,从大量数据屮提取出对业务有意义的信息,以易懂的形式传达