学习 / 神经网络 / 01

神经网络 · 第 01 条 · 基础

从一个神经元开始

一切都从一个很朴素的运算开始:把输入乘上权重加起来,再过一个非线性函数。剩下所有复杂的东西,都是它的堆叠。

难度 入门约 8 分钟前置:无更新 2026-09-28

一个神经元做两件事

y = f(w₁x₁ + w₂x₂ + … + b)
先把输入加权求和,再把它送进一个非线性函数 f。

前半部分(加权求和)是线性的,它只能表示「直线关系」;后半部分的非线性函数(激活函数)才是关键——没有它,堆多少层都等价于一层。

为什么?因为线性函数的叠加仍然是线性函数。两层线性变换套在一起,数学上等价于一个线性变换。非线性是「深度」有意义的前提。

权重是什么

权重(w)代表「这个输入有多重要、是正相关还是负相关」。偏置(b)是一个整体的偏移。训练神经网络,本质上就是在调整所有这些 w 和 b。

一个神经元的能力很有限:它只能画出一条分界线(在二维平面上是一条直线,高维是一个超平面)。它做的是最基础的二分类。

一个神经元:加权求和 → 非线性x₁权重 0.8x₂权重 -1.2x₃权重 0.5Σ加权求和f ( )非线性激活y输出没有 f( ) 的话,堆一百层也等于一层——因为线性函数的叠加仍然是线性的
整个神经网络的最小单元就这么多东西:三个输入、一组权重、一个求和、一个非线性函数。右边那个 f( ) 是关键——拿掉它,前面所有计算就退化成一次简单的加权平均,堆多少层都没用。

从神经元到网络

把很多神经元排成一层,再叠很多层,能力的增长是非线性的:

一个常见的误解

很多人以为神经网络是在「模拟大脑」。这是个不准确的说法。它确实受生物神经元的启发,但机制完全不同——真实神经元有复杂的时间动态、多种神经递质、局部学习规则,而人工神经元只是「加权求和 + 非线性」这个抽象。

把神经网络理解成「一个极其灵活的函数拟合器」,比理解成「电子大脑」更有用,也更接近事实。

为什么它有效

这其实是一个还没有完全答案的问题。目前比较有说服力的解释是:真实世界的高维数据(图像、语言)往往具有某种低维结构,而深层网络恰好是一种能高效表达这种结构的函数形式。

换句话说,不是「网络万能」,而是「网络的结构恰好匹配问题的结构」。这也是为什么不同任务会演化出不同的网络结构(卷积之于图像、注意力之于序列)。

要点回顾
← DCF 的骨架:不追求精确,追求逻辑自洽 前向传播与反向传播 →