当我们睁开眼睛,我们看到的并不仅仅是光,而是图案、边缘、面孔、运动与意义。视觉一直是生命最深奥的谜题之一。从柏拉图到笛卡尔,哲学家不断探问眼睛与心灵如何连接;从乔托到维米尔,艺术家通过透视、阴影与焦点改变了我们理解空间的方式。而到了二十世纪,工程师们开始提出一个更大胆的问题:机器能学会看吗?
计算机视觉的历史不仅是技术的历史,它也是文化的历史。它讲述了人类对“看”的执念——从文艺复兴绘画中透视法的发明,到摄影与电影的兴起——如何塑造了我们关于智慧的观念。因为如果机器能够看见,那么它或许也能思考。
机器视觉的早期迷恋
在数字计算机出现之前,人们就已经梦想着人工的眼睛。十九世纪的暗箱与银版照相机,把“视觉”机械化。哲人们担忧这些机器会取代人的感知。波德莱尔甚至讥讽摄影是“失败画家的避难所”。但摄影并未只是替代,它推动了绘画走向印象派、抽象派与超现实主义。
机器视觉的历程也类似:每一次突破,不仅是对人类视觉的模仿,更改变了我们对“视觉”本身的理解。
五十到六十年代,科学家开始探索计算机如何处理图像。早期系统只能检测简单的边缘和形状,极为粗糙,但它们呼应了生物学的结构:视网膜的杆状体与锥状体,把信号传递给神经元,再汇聚为线条与运动的感知。把视觉分解为一系列计算步骤——边缘检测、形状拼合、物体识别——成为最初的计算机视觉隐喻。
卷积的突破
真正改变机器视觉格局的,是 卷积 的引入。
卷积是一种数学操作:它把两个函数结合成第三个。在图像处理中,卷积意味着让一个小小的滤波器(kernel)在图像上滑动,用来检测局部模式。公式如下:
$h_{i,j} = \sum_m \sum_n w_{m,n} \, x_{i+m, j+n}$
其中 xxx 是输入图像,www 是滤波器,hhh 是输出特征图。不同的滤波器能检测不同的特征:边缘、角点、纹理。
卷积的威力在于两个方面:其一,它大大减少了参数数量——不必为每个像素学习独立的权重;其二,它引入了平移不变性——在左上角检测到的边缘,在右下角也能识别。
更重要的是,它呼应了生物学。二十世纪六十年代,神经科学家胡贝尔与威塞尔发现,视觉皮层的细胞会对特定方向的边缘作出反应。卷积滤波器正是这种神经机制的数字映射。
LeCun 与卷积神经网络的诞生
八十年代末,法国研究者 Yann LeCun 把卷积与反向传播结合,创造了第一个 卷积神经网络(CNN)。他的系统 LeNet 被用于邮政编码的手写数字识别。结构是卷积层与池化层的堆叠,再接上全连接层完成分类。
效果令人惊叹。LeNet 的准确率超过了人工分拣员。然而在当时,除了少数应用,CNN 并未广泛流行。原因在于计算机速度不够快、数据集不够大,而“AI 寒冬”让人们缺乏雄心。研究者转向人工特征工程:SIFT、HOG 等算法。这些方法手工设计精巧,但面对变化与噪声却显得脆弱。
2012年的 AlexNet 革命
真正的转折发生在 2012 年。在 ImageNet 大规模视觉识别挑战赛上,亚历克斯·克里热夫斯基(Alex Krizhevsky)、苏茨凯弗(Ilya Sutskever)与辛顿(Geoffrey Hinton)推出了 AlexNet。
这是一种八层深的 CNN,用 GPU 训练了数周。结果惊人:Top-5 错误率仅 15.3%,而第二名为 26.2%。差距之大震动了整个领域。
从那一刻起,CNN 席卷计算机视觉。人脸识别、医学影像、自动驾驶……各行各业都因卷积神经网络而焕然一新。谷歌、Facebook 等公司也依靠视觉识别和推荐系统建立了庞大的商业帝国。
CNN 背后的数学从 LeCun 时代起几乎没变,变化的是规模:GPU 的加速、ImageNet 的大规模数据、以及 dropout、ReLU 等训练技巧的加入。就像许多 AI 突破一样,公式简单,条件却终于成熟。
视觉与文化
机器视觉的崛起带来深远的文化影响。摄影曾让我们重新思考“真实的捕捉”,CNN 则迫使我们重新思考“感知的本质”。
以人脸识别为例。对机器而言,面孔不是人,而是像素模式,被映射到特征空间中。然而当政府将其用于监控,或社交网络自动为我们打标签时,它触碰到的却是身份、隐私与自由。
艺术领域同样发生巨变。基于卷积的生成对抗网络(GANs)与扩散模型(Diffusion Models)能创造逼真的人像。摄影与想象的边界被模糊。正如维米尔借助暗箱改变了绘画的写实观,AI 生成的图像也让我们在数字时代重新追问“作者”与“真实”。
数学上的层次感
CNN 的精妙在于层次结构。低层检测边缘、角点与纹理;中层识别物体的部分——眼睛、车轮、树枝;高层则识别完整的物体——猫、汽车、树木。这种分层关系可以用函数复合表示:
$f(x) = f^{(L)}(f^{(L-1)}(\cdots f^{(1)}(x)))$
每一层 f(l)f^{(l)}f(l) 都是一次表征转换,让复杂性逐级累积。这种分层组合,恰如艺术、语言与文化本身的运作方式:从简单元素构建更复杂的结构。
超越卷积
讽刺的是,当 CNN 看似无可替代时,新的模型又出现了。2020 年,Vision Transformer(ViT)将语言模型的自注意力机制应用到图像。它把图像切分为 patch,当作 token 处理,从而捕捉全局关系。很快,ViT 在多个任务上超过了 CNN。
然而,CNN 并未消失。它在效率、局部特征与可解释性方面仍具优势,被广泛用于医学扫描、智能手机、卫星图像。即便在某些前沿领域被取代,它的遗产已不可磨灭。
机器视觉的深层意义
说 AI 会“看”,是一种隐喻,但也迫使我们反思“看”究竟是什么。看,是捕捉光子,还是解释模式?当 CNN 识别一只狗,它并没有看到毛发或尾巴,而是看到了像素阵列的排列。但这与我们真的那么不同吗?我们的视网膜捕捉光,神经元滤波拼合,大脑再赋予意义。
更深的文化问题是:如果机器也能看,人类还有什么独特之处?有人认为人类视觉与意识、语境和想象不可分割;也有人认为,机器视觉并不是威胁,而是扩展,就像望远镜与显微镜一样,把感知延伸到人类原本无法触及的世界。
前行之路
机器视觉的故事,是一个坚持的故事。从 LeCun 的 LeNet,到 AlexNet 的惊艳登场,从 GAN 人像到 Vision Transformer,人工视觉不断重塑科技与文化。
未来,它可能走向具身智能,让机器人用视觉在真实环境中行动;它可能推动医学突破,让医生更早发现疾病;它可能孕育新的艺术形式,让人机视觉的合作开辟新的表达方式。
可以确定的是,视觉将依然是人工智能的核心。智慧离不开感知,而感知最根本的入口便是“看”。
未来的人们回望今日,或许会把 CNN 看作类似暗箱的转折点:它让电路学会了看,而在此过程中,也教会了我们如何重新看待自己。
我的其它文章
当AI不肯认输
AI越狱:事实与夸张
当AI进入社会:工作、教育与人的未来 (一)(下)
当AI进入社会:工作、教育与人的未来 (一)(上)
空间是什么?(2)
空间是什么?(1)
当AI开始突破边界:辛顿的警告值得我们认真对待吗?
谁在定义“奇点”
关于ChatGPT的记忆功能
探问LLM 与意识边界(2)思维的镜子:LLM 揭示了我们思维的真实结构?
探问LLM 与意识边界(1)觉醒的错觉:为什么 LLM 不能通向 AGI?
2026 年 AI 前瞻:当“基础设施”开始长出阀门与责任
2025 年的人工智能:当“魔法”变成基础设施
基督教柏拉图主义:理念、逻各斯与形式之神(下)
电路之眼:人工智能如何学会看世界
感知机、逻辑与机器学习的诞生
从神谕到算法:人类关于智慧的古老梦想
诺斯替主义回归:知识、觉醒与意识世界的层次论(上)
当AI有了自我:生存是否也会驱动它的进化
语言模型只是起点:神经符号AI的复兴与挑战 (2)
语言模型只是起点:神经符号AI的复兴与挑战 (1)
世界模型与智能体:AI如何“理解”它所身处的世界?(2)
世界模型与智能体:AI如何“理解”它所身处的世界?(1)
冷聚变风波:当希望跑在证据前面
- 当AI不肯认输 - 09/04/26
- AI越狱:事实与夸张 - 09/02/26
- 当AI进入社会:工作、教育与人的未来 (一)(下) - 08/28/26
