在技術(shù)快速跟新?lián)Q代的互聯(lián)網(wǎng)行業(yè),已有 3年 歷史 “大數(shù)據(jù)” 聽起來似乎已經(jīng)過氣了。雖然 Hadoop 在 2006年 已經(jīng)出來,但 “大數(shù)據(jù)” 這個概念大概是在 2011 到 2014年 左右才真正火起來的。也就是在這段時間里,至少是在媒體或者專家眼里,“大數(shù)據(jù)” 成為了新的 “金子” 或者 “石油”。然而,至少在我跟業(yè)界人士交談中,大家越來越感覺到這項技術(shù)已經(jīng)在某種程度上陷入了停滯。
拋開不可避免的炒作周期曲線態(tài)勢不管,我們的 “大數(shù)據(jù)版圖” 已經(jīng)進(jìn)入第 4 個年頭了,趁這個時候退一步來反思一下去年發(fā)生了什么,思考一下這個行業(yè)的未來會怎樣是很有意義的。
到了2016年,大數(shù)據(jù)到底還是否依然能站在互聯(lián)網(wǎng)的前端呢,中培偉業(yè)《大數(shù)據(jù)Hadoop與Spark架構(gòu)應(yīng)用實戰(zhàn)》專家蔣老師給出了自己的觀點。
蔣老師指出,大數(shù)據(jù)有趣的一點在于,它不再像當(dāng)初經(jīng)歷過那樣有可能成為炒作的題材了。經(jīng)過炒作周期后仍能引起廣泛興趣的產(chǎn)品和服務(wù)往往那些大家能夠接觸、可以感知,或者與大眾相關(guān)聯(lián)的:比如移動應(yīng)用、社交網(wǎng)絡(luò)、可穿戴、虛擬現(xiàn)實等。
但大數(shù)據(jù)基本上就是管道設(shè)施的一種。當(dāng)然,大數(shù)據(jù)為許多消費者或商業(yè)用戶體驗提供了動力,但它的核心是企業(yè)技術(shù):數(shù)據(jù)庫、分析等,這些東西都是在后端運行的,沒幾個人能看得見。就像在那個世界工作的任何人都知道那樣,用一個晚上的時間就想適應(yīng)企業(yè)端的新技術(shù)是不可能的。
大數(shù)據(jù)現(xiàn)象在早期主要是受到了與一批骨干互聯(lián)網(wǎng)公司(尤其是 Google、Facebook、Twitter 等)的共生關(guān)系的推動,這些公司既是核心大數(shù)據(jù)技術(shù)的重度用戶,同時也是這些技術(shù)的創(chuàng)造者。這些公司突然間面對著規(guī)模前所未有的龐大數(shù)據(jù)時,由于本身缺乏傳統(tǒng)的(昂貴的)基礎(chǔ)設(shè)施,也沒有辦法招募到一些最好的工程師,所以只好自己動手來開發(fā)所需的技術(shù)。后來隨著開源運動的迅速發(fā)展,一大批此類新技術(shù)開始共享到更廣的范圍。然后,一些互聯(lián)網(wǎng)大公司的工程師離職去創(chuàng)辦自己的大數(shù)據(jù)初創(chuàng)企業(yè)。其他的一些 “數(shù)字原生” 公司,包括嶄露頭角的獨角獸公司,也開始面臨著互聯(lián)網(wǎng)大公司的類似需求,由于它們自身也沒有傳統(tǒng)的基礎(chǔ)設(shè)施,所以自然就成為了那些大數(shù)據(jù)技術(shù)的早期采用者。而早期的成功又導(dǎo)致了更多的創(chuàng)業(yè)活動發(fā)生,并獲得了更多的 VC 資助,從而帶動了大數(shù)據(jù)的起勢。
快速發(fā)展了幾年之后,現(xiàn)在我們面臨的是更加廣闊、但也更加棘手的機遇:讓中等規(guī)模到跨國公司級別的更大一批企業(yè)采用大數(shù)據(jù)技術(shù)。這些公司跟 “數(shù)字原生” 公司不一樣的是,他們沒有從零開始的有利條件。而且他們失去的會更多:這些公司絕大部分的現(xiàn)有技術(shù)基礎(chǔ)設(shè)施都是成功的。那些基礎(chǔ)設(shè)施當(dāng)然未必是功能完備的,組織內(nèi)部許多人也意識到對自己的遺留基礎(chǔ)設(shè)施進(jìn)行現(xiàn)代化應(yīng)該是早點好過晚點,但他們不會一夜間就把自己的關(guān)鍵業(yè)務(wù)取代掉。任何革命都需要過程、預(yù)算、項目管理、試點、局部部署以及完備的安全審計等。大企業(yè)對由年輕的初創(chuàng)企業(yè)來處理自己基礎(chǔ)設(shè)施的關(guān)鍵部分的謹(jǐn)慎是可以理解的。還有,令創(chuàng)業(yè)者感到絕望的是,許多(還是大多數(shù)?)企業(yè)仍頑固地拒絕把數(shù)據(jù)遷移到云端(至少不愿遷移到公有云)。
還需要理解的另一個關(guān)鍵是:大數(shù)據(jù)的成功不在于實現(xiàn)技術(shù)的某一方面(像 Hadoop 什么的),而是需要把一連串的技術(shù)、人和流程糅合到一起。你得捕捉數(shù)據(jù)、存儲數(shù)據(jù)、清洗數(shù)據(jù)、查詢數(shù)據(jù)、分析數(shù)據(jù)并對數(shù)據(jù)進(jìn)行可視化。這些工作一部分可以由產(chǎn)品來完成,而有的則需要人來做。一切都需要無縫集成起來。最后,要想讓所有這一切發(fā)揮作用,整個公司從上到下都需要樹立以數(shù)據(jù)驅(qū)動的文化,這樣大數(shù)據(jù)才能依然風(fēng)流。