上篇结尾,我们聊到人工智能在世纪之交陷入了"三缺"困境:缺数据、缺算力、缺一个能用的算法。专家们在实验室里苦苦折腾,就像厨子守着没米的锅——手艺再好也做不出饭来。

然后,2012 年的秋天,一声惊雷劈开了阴云。

那一年我还在用一台风扇呼呼作响的老笔记本,看视频卡得像放 PPT,手机是块砖头一样的安卓机,拍照糊得像印象派油画。而就在这一年,计算机视觉领域发生了一件事,让所有人的下巴都掉到了地上。这篇中篇,就从这声惊雷讲起——讲讲 2012 到 2022 这十年,深度学习如何一路点燃了整个世界。

十年星火,一张时间线

2012

AlexNet:一声惊雷

这一年,ImageNet 图像识别竞赛上,一支名不见经传的队伍用一个叫 AlexNet 的卷积神经网络参赛,把错误率从 26% 一口气干到了 15.3%——直接砍掉近一半!评委们揉了揉眼睛,怀疑是不是看错了。要知道,在此之前,计算机视觉圈子对神经网络普遍是"嗤之以鼻"的态度,觉得那是上世纪玩剩下的老古董。结果 AlexNet 用两块 GTX 580 显卡(当年一块要四五千块人民币,学生党咬咬牙才买得起),吭哧吭哧训练了五六天,就把传统方法按在地上摩擦。我记得当年在论坛看到这个消息,评论区清一色"???"——大家都意识到,有什么东西不一样了。后来有人说,2012 年的 ImageNet,就是深度学习的"大爆炸奇点"。

2014

GAN:酒吧餐巾纸上的天才想法

2014 年,伊恩·古德费洛(Ian Goodfellow)在蒙特利尔一家酒吧里跟朋友喝酒,聊着聊着,突然在餐巾纸上画出了 GAN(生成对抗网络)的雏形。思路绝了:让两个神经网络互掐——一个负责"造假"生成图片,一个负责"打假"鉴别真伪,两个越掐越强,最后造假的那个连人眼都骗得过。第一张 GAN 生成的"人脸"现在看起来糊得像马赛克,但当时已经足够惊人。谁能想到,八年后风靡全球的 AI 绘画,祖师爷就是这张餐巾纸呢?天才的灵感,有时候真的只需要一杯啤酒的功夫。

2016

AlphaGo 大战李世石:那个不眠的春天

2016 年 3 月,首尔。DeepMind 的 AlphaGo 挑战世界围棋冠军李世石。那几天我熬夜看直播,朋友圈彻底刷屏,各种"人类最后尊严"的段子满天飞——"围棋是人类智慧最后的堡垒""堡垒从内部被攻破了"……前三局 AlphaGo 连下三城,弹幕里一片哀嚎,气氛丧得像世界末日。结果第四局,李世石下出了围棋史上著名的"神之一手"(第 78 手),硬生生从 AI 手里抢回一局!我当时在屏幕前直接喊出声来,室友还以为我中了彩票。那一刻的感觉特别复杂:既为人类棋手骄傲得想哭,又清楚地知道——时代真的变了。最终比分 4:1,AI 赢了,但李世石赢得了所有人的尊敬。这一战之后,"人工智能"四个字第一次真正走进了千家万户的茶余饭后。

2017

Transformer:八个作者,一篇封神

2017 年 6 月,谷歌大脑团队扔出一篇论文,标题霸气侧漏:《Attention Is All You Need》(你只需要注意力)。这篇论文提出的 Transformer 架构,彻底抛弃了传统的循环结构,全靠"注意力机制"来处理序列——训练速度快得离谱,效果还好。当时没几个人意识到,这篇只有八位作者的论文,会成为未来十年 AI 的"地基"。更有意思的是后来的八卦:这八位作者后来大多离开了谷歌,纷纷跑出去创业,成了 AI 创业圈的"梦之队"。有人说,这是谷歌历史上"最贵的一次人才流失";也有人说,正是这种出走,才点燃了整个大模型时代的燎原之火。一篇论文,八个人,改写了一个行业——传奇不过如此。

2018

BERT 与 GPT-1:双雄并起

2018 年是 Transformer 开花结果的一年,诞生了 NLP(自然语言处理)史上的"双子星"。谷歌的 BERT 像个"阅读理解学霸",把 11 项语言理解任务的纪录刷了个遍,开源出来后人人都能用,学术界欢呼雀跃;而 OpenAI 的 GPT-1 则走了另一条路:用"生成式预训练"教会模型"说话",虽然当时只有 1.17 亿参数,名气不如 BERT,但它埋下了一颗种子——"大力出奇迹"的种子。一边是精巧的理解派,一边是野蛮生长的生成派,谁也没想到,几年后后者会彻底统治江湖。

2020

GPT-3:1750 亿参数的震撼

2020 年 6 月,OpenAI 发布 GPT-3,参数量直接干到 1750 亿——是 GPT-2 的 116 倍!这个数字当时把所有人都吓傻了。更吓人的是它的表现:写文章、写代码、做翻译、编故事,样样都像模像样,甚至能"举一反三",给几个例子就能学会新任务(这就是后来的"提示工程"的雏形)。我第一次试玩 GPT-3 的 demo 时,让它续写一段小说,它写出来的文字流畅得让我后背发凉,心里只有一个念头:"写作这碗饭,还能吃几年?"从两块 GTX 580 训练五六天,到 GPT-3 烧掉上千万美元、用上万块顶级显卡训练——短短八年,AI 的"军备竞赛"已经夸张到普通人难以想象的地步。

算力价格今昔对比:2012 年 AlexNet 用两块 GTX 580(当年约四五千元一块),一个宿舍就能凑齐装备,训练五六天搞定;到了 GPT-3 时代,训练一次要烧掉上千万美元,动用上万块 A100 这样的顶级显卡——这已经不是"买电脑"的概念,而是"建发电厂"的概念。算力,成了 AI 时代新的石油。
2016年AlphaGo对战李世石
2016 年 3 月,首尔,AlphaGo 对阵李世石——那场让全世界熬夜的"人机大战"
一句话讲清 Transformer 的注意力机制:读句子时,人脑会自动抓住关键词(比如看到"银行"会联想到"钱"而不是"河岸"),Transformer 的"注意力"就是让机器也学会这种"抓重点"的本事——每个词都环顾四周,掂量一下谁跟自己关系最大。原理说起来简单,但正是这个简单的想法,撑起了整个大模型时代。

回头看这十年,故事线其实特别清晰:AlexNet 证明了"深度学习真能打",GAN 证明了"AI 还能创造",AlphaGo 证明了"AI 能超越人类直觉",Transformer 则递上了"通往通用智能的钥匙",而 GPT 系列一步步把这把钥匙插进了锁孔。从图像到围棋再到语言,AI 的领地每两三年就扩张一圈。

别光顾着欢呼,也看看阴影:深度学习这十年风光无限,但毛病也不少——它是"数据喂出来的",数据里有什么偏见,它就学会什么偏见(比如招聘 AI 歧视女性简历的翻车案例);它还是个"黑箱",连设计者都说不清它为什么做出某个判断。这些问题在 2022 年之前只是学术圈的争论,但很快,全世界都要被迫直面它们。

小结

2012 到 2022,是深度学习从"实验室惊雷"变成"时代洪流"的十年。它始于两块游戏显卡,终于上万块 AI 芯片的军备竞赛;始于一小撮极客的狂欢,终于全人类茶余饭后的谈资。这十年里,AI 学会了看图、学会了下棋、学会了"说话"——每一步都踩在算力、数据和天才想法的交汇点上。

给读者的启发其实就一句:别小看任何一次"惊雷"。2012 年嘲笑神经网络的人,2016 年说"AI 下围棋也就那么回事"的人,2020 年说"GPT-3 不过是个高级鹦鹉"的人——都被现实轻轻打了脸。技术浪潮来临时,最好的姿势不是预测它有多远,而是先跳上船再说。

那么,GPT-3 之后发生了什么?2022 年底,一个小小的聊天框横空出世,一夜之间让全世界都开始跟 AI 聊天——下篇,我们聊 ChatGPT 爆火与大模型时代,看看这场十年大火,是如何烧成燎原之势的。

此作者没有提供个人介绍。
最后更新于 2026-09-30