ZKIZ Archives


誰能做大數據工程師?

來源: http://www.yicai.com/news/2014/11/4040537.html

這可能是未來最具發展潛力的職業之一了。

數據是眼下非常時髦的技術名詞,與此同時自然也催生出了一些與大數據處理相關的職業,通過對數據的挖掘分析來影響企業的商業決策。

這群人在國外被叫做數據科學家(Data Scientist),這個頭銜最早由D.J.Pati和Jeff Hammerbacher於2008年提出,他們後來分別成為了領英(LinkedIn)和Facebook數據科學團隊的負責人。而數據科學家這個職位目前也已經在美國傳統的電信、零售、金融、制造、物流、醫療、教育等行業里開始創造價值。

 

不過在國內,大數據的應用才剛剛萌芽,人才市場還不那麽成熟,“你很難期望有一個全才來完成整個鏈條上的所有環節。更多公司會根據自己已有的資源和短板,招聘能和現有團隊互補的人才。”領英(LinkedIn)中國商務分析及戰略總監王昱堯對《第一財經周刊》說。

於是每家公司對大數據工作的要求不盡相同:有的強調數據庫編程、有的突出應用數學和統計學知識、有的則要求有咨詢公司或投行相關的經驗、有些是希望能找到懂得產品和市場的應用型人才。正因為如此,很多公司會針對自己的業務類型和團隊分工,給這群與大數據打交道的人一些新的頭銜和定義:數據挖掘工程師、大數據專家、數據研究員、用戶分析專家等都是經常在國內公司里出現的Title,我們將其統稱為“大數據工程師”。

王昱堯認為,在一個成熟的數據驅動型公司,“大數據工程師”往往是一個團隊,它意味著從數據的收集、整理展現、分析和商業洞察、以至於市場轉化的全過程。這個團隊中可能包括數據工程師、分析師、產品專員、市場專員和商業決策者等角色,共同完成從原始數據到商業價值的轉換—概括來講,這是一個支持企業做出商業決策、發掘商業模式的重要群體。

由於國內的大數據工作還處在一個有待開發的階段,因此能從其中挖掘出多少價值完全取決於工程師的個人能力。已經身處這個行業的專家給出了一些人才需求的大體框架,包括要有計算機編碼能力、數學及統計學相關背景,當然如果能對一些特定領域或行業有比較深入的了解,對於其快速判斷並抓準關鍵因素則更有幫助。

雖然對於一些大公司來說,擁有碩博學歷的公司人是比較好的選擇,不過阿里巴巴集團研究員薛貴榮強調,學歷並不是最主要的因素,能有大規模處理數據的經驗並且有喜歡在數據海洋中尋寶的好奇心會更適合這個工作。

除此之外,一個優秀的大數據工程師要具備一定的邏輯分析能力,並能迅速定位某個商業問題的關鍵屬性和決定因素。“他得知道什麽是相關的,哪個是重要的,使用什麽樣的數據是最有價值的,如何快速找到每個業務最核心的需求。”聯合國百度大數據聯合實驗室數據科學家沈誌勇說。學習能力能幫助大數據工程師快速適應不同的項目,並在短時間內成為這個領域的數據專家;溝通能力則能讓他們的工作開展地更順利,因為大數據工程師的工作主要分為兩種方式:由市場部驅動和由數據分析部門驅動,前者需要常常向產品經理了解開發需求,後者則需要找運營部了解數據模型實際轉化的情況。

你可以將以上這些要求看做是成為大數據工程師的努力方向,因為根據萬寶瑞華管理合夥人顏莉萍的觀察,這是一個很大的人才缺口。目前國內的大數據應用多集中在互聯網領域,有超過56%的企業在籌備發展大數據研究,“未來5年,94%的公司都會需要數據科學家。”顏莉萍說。因此她也建議一些原本從事與數據工作相關的公司人可以考慮轉型。

本期《第一財經周刊》采訪了BAT這3家國內互聯網公司,以及相關領域的人力資源專家,他們從職場角度為我們解讀如何成為大數據工程師以及這類崗位的職場現狀。

A 大數據工程師做什麽?

用阿里巴巴集團研究員薛貴榮的話來說,大數據工程師就是一群“玩數據”的人,玩出數據的商業價值,讓數據變成生產力。大數據和傳統數據的最大區別在於,它是在線的、實時的,規模海量且形式不規整,無章法可循,因此“會玩”這些數據的人就很重要。

沈誌勇認為如果把大數據想象成一座不停累積的礦山,那麽大數據工程師的工作就是,“第一步,定位並抽取信息所在的數據集,相當於探礦和采礦。第二步,把它變成直接可以做判斷的信息,相當於冶煉。最後是應用,把數據可視化等。”

因此分析歷史、預測未來、優化選擇,這是大數據工程師在“玩數據”時最重要的三大任務。通過這三個工作方向,他們幫助企業做出更好的商業決策。

找出過去事件的特征

大數據工程師一個很重要的工作,就是通過分析數據來找出過去事件的特征。比如,騰訊的數據團隊正在搭建一個數據倉庫,把公司所有網絡平臺上數量龐大、不規整的數據信息進行梳理,總結出可供查詢的特征,來支持公司各類業務對數據的需求,包括廣告投放、遊戲開發、社交網絡等。

找出過去事件的特征,最大的作用是可以幫助企業更好地認識消費者。通過分析用戶以往的行為軌跡,就能夠了解這個人,並預測他的行為。“你可以知道他是什麽樣的人、他的年紀、興趣愛好,是不是互聯網付費用戶、喜歡玩什麽類型的遊戲,平常喜歡在網上做什麽事情。”騰訊雲計算有限公司北京研發中心總經理鄭立峰對《第一財經周刊》說。下一步到了業務層面,就可以針對各類人群推薦相關服務,比如手遊,或是基於不同特征和需求衍生出新的業務模式,比如微信的電影票業務。

預測未來可能發生的事情

通過引入關鍵因素,大數據工程師可以預測未來的消費趨勢。在阿里媽媽的營銷平臺上,工程師正試圖通過引入氣象數據來幫助淘寶賣家做生意。“比如今年夏天不熱,很可能某些產品就沒有去年暢銷,除了空調、電扇,背心、遊泳衣等都可能會受其影響。那麽我們就會建立氣象數據和銷售數據之間的關系,找到與之相關的品類,提前警示賣家周轉庫存。”薛貴榮說。

在百度,沈誌勇支持“百度預測”部分產品的模型研發,試圖用大數據為更廣泛的人群服務。已經上線的包括世界杯預測、高考預測、景點預測等。以百度景點預測為例,大數據工程師需要收集所有可能影響一段時間內景點人流量的關鍵因素進行預測,並為全國各個景點未來的擁擠度分級—在接下來的若幹天時間里,它究竟是暢通、擁擠,還是一般擁擠?

找出最優化的結果

根據不同企業的業務性質,大數據工程師可以通過數據分析來達到不同的目的。

以騰訊來說,鄭立峰認為能反映大數據工程師工作的最簡單直接的例子就是選項測試(AB Test),即幫助產品經理在A、B兩個備選方案中做出選擇。在過去,決策者只能依據經驗進行判斷,但如今大數據工程師可以通過大範圍地實時測試—比如,在社交網絡產品的例子中,讓一半用戶看到A界面,另一半使用B界面,觀察統計一段時間內的點擊率和轉化率,以此幫助市場部做出最終選擇。

作為電商的阿里巴巴,則希望通過大數據鎖定精準的人群,幫助賣家做更好的營銷。“我們更期待的是你能找到這樣一批人,比起現有的用戶,這些人對產品更感興趣。”薛貴榮說。一個淘寶的實例是,某人參賣家原來推廣的目標人群是產婦,但工程師通過挖掘數據之間的關聯性後發現,針對孕婦群體投放的營銷轉化率更高。

PermaLink: https://articles.zkiz.com/?id=119304

Next Page

ZKIZ Archives @ 2019