"神经网络"这四个字唬住了不少人,一听就以为电脑里真装了个大脑。其实它就是一种计算结构:把一个大问题拆成一层一层的简单判断,每层只做一点点事,把结果往上传,最后汇成一个答案。电脑里没有大脑,只有成千上万条小公式在接力。
拿一个用图像卷积网络做相册"自动分类"的简化例子来说:你拍了一张猫的照片,相册不用你动手,就把它归进了"猫"这一组。它是怎么认出来的?假设照片先被缩小成一张适合模型输入的小图,每个点变成几个数字(颜色的深浅);第一层的"神经元"各自只盯着几个相邻的点看,专挑明暗突变的地方——也就是边缘;第二层把边缘拼成弧线、尖角这些简单形状;第三层拼出"尖耳朵""胡须""圆眼睛"这类部件;最后一层给候选答案挨个打分:猫 92、狗 5、兔子 3——得,归到"猫"。整个过程不到一秒。而且从头到尾,没人告诉过它"猫有尖耳朵"——这些判断标准是它自己从成千上万张标好答案的图里摸出来的。
认出猫:数字经过层层加工
- 01输入
像素颜色值
- 02中间层
逐层组合特征
- 03输出
候选类别打分
图像分类网络的简化例子;层数、功能和分数均为示意,不代表具体产品。
认出一只猫,要分好几层
把上面这个过程拆开,关键是四条:
1. 进到网络里的全是数字。 照片是像素点的颜色值,声音是声波切成的采样值,连文字也得先转成数字编号。网络根本不知道"猫"是什么,它眼里只有一堆数。
2. 每层把收到的数进一步加工,再传给后面的层。 单个"神经元"干的事小得可怜:把收到的几个数各自乘个系数、加起来、过一道坎,输出一个数。但几千个这样的小单元排成一层,就能找出"哪里有边缘";几层接力,大事就成了。
3. 越靠后的层,认的东西越抽象。 可以粗略理解成:靠前的层认明暗边缘,中间的层认弧线和尖角,靠后的层认"尖耳朵""胡须"这类部件——一层一层把像素"翻译"成概念,最后一层才有东西可投票。
4. 判断标准不是人写的,是拿例子喂出来的。 工程师只负责搭好结构、备好比学资料:成千上万张标好"这是猫""这是狗"的图。网络每猜错一次,那些系数就被往对的方向拧一点,拧上成千上万次,标准就"长"出来了。这一步叫"训练",也是"机器学习"(详见该词条)最主流的做法。
"神经"两个字,是从大脑借来的
这名字不是瞎起的。上世纪四十年代,科学家受大脑神经元的启发:一个神经元接收很多路信号,攒够了"兴奋"就放一次电,把信号传给下一个。他们照这个意思设计出一条小公式——收一堆数、加权相加、过坎输出——这就是人造"神经元",成千上万个首尾相接,就叫"神经网络"。1958年已有感知机的经典论文,之后发展经历了几轮起伏,直到 2012 年前后靠更强的算力和海量数据爆发,才有了今天新闻里天天见的"深度学习"。
但别被名字带偏:它只是借了神经元一个大概意思,并没有真的模仿大脑。真实的神经元有复杂的电化学反应和放电节律,比那条小公式复杂几个数量级;人脑怎么思考、意识从哪来,科学界自己都还没搞清。说"神经网络模拟人脑",就像说"飞机模拟鸟"——灵感都来自生物,可一个靠机翼和发动机,一个靠扇翅膀,工作方式完全不是一回事。
两个常见误会
误会一:神经网络就是在电脑里造了个大脑,所以它会思考、有想法。 不会。它只有计算,没有"想法":你给它一张图,它输出一串分数,中间没有任何"觉得""认为"。新闻里说"AI 认出了猫""AI 看懂了画",那是省事的比喻说法,真拆开看,就是一层接一层地算数。
误会二:它认出了猫,就说明它"懂"什么是猫。 它不懂。它掌握的是统计规律:训练过的图里"猫"长什么样。所以图片一旦超出它熟悉的范围——卡通猫、抽象画、奇怪的拍摄角度——就可能投票投错,还错得理直气壮,照样打出九十多分。聊天用的大语言模型(详见该词条)也是超大号的神经网络:它能"接上话",同样不等于"懂意思",一本正经编错话就是这么来的。