"大数据"这词新闻里天天见,其实说的不是"数据很多"这么简单。它指的是量大、来得快、种类杂到传统方法处理不了的数据,以及处理这类数据的技术。例如一家小超市的少量年度销售记录,普通表格就能算清,通常不必用大数据架构;一座城市几千万部手机每时每刻的位置、几万个路口摄像头的画面、几十亿条支付记录,这才是大数据要面对的东西。

举个例子:导航软件怎么知道哪条路正在堵?它背后是成千上万车主实时上传的位置和车速,每秒涌进来几十万条。系统把这些点按路段一汇总:这段路平时车速 60,现在平均只有 15,而且慢的车越来越多——判定拥堵,再把你引到旁边的路。单看任何一辆车什么也说明不了,数据聚成一片,规律就浮出来了。

一眼看懂 / 示意图

一辆车慢,和一条路都慢

一辆车慢,和一条路都慢一整段,多辆车都慢下来平时 60 → 当前 15位置+时间+车速 → 按路段汇总 → 拥堵线索
  1. 01单点

    可能只是这辆车停下了

  2. 02路段汇总

    多辆车持续低速,形成拥堵线索

正文为简化情境,不是导航产品实测;还需地图匹配等处理。

大到什么程度才算"大"

业内常从三个角度看,记不住的记住"多到普通工具扛不住"就行:

1. 量大。 不是几千几万条,而是动辄几亿、几十亿条,还在不停涨。当单机资源不够时,可以拆到多台机器分开存、分开算;没有统一的条数或机器数门槛(相关词条:数据库)。

2. 来得快。 不是月底汇总一次的报表,而是实时涌进来的流水:点击、定位、刷卡、传感器读数,这边产生那边就要处理,导航这种应用慢一分钟就没用了。

3. 种类杂。 传统数据库里的是整齐的表格:姓名、金额、日期。大数据里混着文字、图片、语音、视频、日志,格式五花八门,光"把这些东西归拢到能一起分析"就是一大半的活。

它能干什么、不能干什么

能干的:从海量记录里找规律、做预测。 哪条路几点会堵、哪类商品会一起被买走、哪台机器的读数异常可能要出故障——这些都是"从大量历史里看出苗头"的活。购物 App 给你推"猜你喜欢",靠的也是海量人的行为数据(相关词条:算法推荐)。它的预测常常相当准,准到能影响一个城市的红绿灯怎么调。

不能直接做到的:只凭相关就断定"为什么"。 这是最容易被忽略的一条。大数据擅长发现"两件事总是一起出现"(相关关系),但它本身回答不了"是谁导致了谁"(因果关系)。数据说"买 A 的人八成也买 B",它能告诉你这个规律存在,至于为什么会这样——是 A 勾起了对 B 的需求,还是两类人恰好重合——得靠人去分析、实验、验证,数据自己不会开口解释。

两个常见误会

误会一:数据多 = 结论可靠。 不一定。数据再大,如果来源本身偏了,结论照样歪。比如只用某 App 的用户数据研究"全国人的消费习惯",这个 App 的用户偏年轻,结论就会系统性地偏向年轻人。大数据大在数量,不保证代表性。

误会二:"大数据显示"就是权威结论。 新闻里"大数据显示……"开头的说法,要先问两句:数据是谁的、怎么统计的、相关还是因果?同样一堆数据,换种统计口径能讲出相反的故事。而且商家说"大数据显示你该买这个",很可能只是算法想让你买——"大数据杀熟"就是这套技术的另一面:用你的数据画像反过来给你报高价(相关词条:大数据杀熟)。