一个神经元做两件事
y = f(w₁x₁ + w₂x₂ + … + b)
先把输入加权求和,再把它送进一个非线性函数 f。
先把输入加权求和,再把它送进一个非线性函数 f。
前半部分(加权求和)是线性的,它只能表示「直线关系」;后半部分的非线性函数(激活函数)才是关键——没有它,堆多少层都等价于一层。
为什么?因为线性函数的叠加仍然是线性函数。两层线性变换套在一起,数学上等价于一个线性变换。非线性是「深度」有意义的前提。
权重是什么
权重(w)代表「这个输入有多重要、是正相关还是负相关」。偏置(b)是一个整体的偏移。训练神经网络,本质上就是在调整所有这些 w 和 b。
一个神经元的能力很有限:它只能画出一条分界线(在二维平面上是一条直线,高维是一个超平面)。它做的是最基础的二分类。
从神经元到网络
把很多神经元排成一层,再叠很多层,能力的增长是非线性的:
- 宽度(一层里多少神经元)决定「能同时考虑多少种特征组合」。
- 深度(多少层)决定「能组合出多抽象的概念」——浅层学边缘和纹理,深层学形状和物体。
- 这就是「深度学习」里「深度」二字的由来。
一个常见的误解
很多人以为神经网络是在「模拟大脑」。这是个不准确的说法。它确实受生物神经元的启发,但机制完全不同——真实神经元有复杂的时间动态、多种神经递质、局部学习规则,而人工神经元只是「加权求和 + 非线性」这个抽象。
把神经网络理解成「一个极其灵活的函数拟合器」,比理解成「电子大脑」更有用,也更接近事实。
为什么它有效
这其实是一个还没有完全答案的问题。目前比较有说服力的解释是:真实世界的高维数据(图像、语言)往往具有某种低维结构,而深层网络恰好是一种能高效表达这种结构的函数形式。
换句话说,不是「网络万能」,而是「网络的结构恰好匹配问题的结构」。这也是为什么不同任务会演化出不同的网络结构(卷积之于图像、注意力之于序列)。
要点回顾
- 一个神经元 = 加权求和 + 非线性激活;权重和偏置就是被训练的参数。
- 没有非线性,多层网络等价于一层——非线性是「深度」有意义的前提。
- 单个神经元只能画一条分界线;宽度决定特征组合能力,深度决定抽象层次。
- 把它理解成「灵活的函数拟合器」,比理解成「模拟大脑」更准确。
- 它有效的原因,很可能是因为深层网络的结构恰好匹配真实数据的结构。