何恺明:广州少年高考满分进清华,一篇AI论文奠定ChatGPT底层基础,现任职MIT副教授
AI人物 | 感受他们为世界做出的贡献
ChatGPT、Claude、Gemini、DeepSeek,今天的大模型基本都基于同一个网络结构:Transformer。
Transformer里有一个不可或缺的设计,叫"残差连接"(residual connection)。
残差连接出自2015年的一篇论文。第一作者是个广州人,何恺明。
那年他31岁,在微软亚洲研究院做研究员。
广州执信中学
何恺明1984年生在广州,中学读的是广州执信中学。
2003年5月,他凭着全国中学生物理竞赛一等奖,被保送清华大学机械工程及自动化专业。当时距离高考只剩一个月。
他还是去考了。
2003年广东高考实行标准分制,满分900分。何恺明拿了900分。当年广东省9位满分状元之一。
进了清华,他没去机械系,转去了基础科学班。
香港中文大学 + 微软亚洲研究院
2007年清华本科毕业,何恺明进香港中文大学读博士,导师是汤晓鸥(后来商汤科技的创始人)。
读博期间,他在微软亚洲研究院(MSRA)实习。
2009年,他25岁,发了一篇研究图像去雾的论文:Single Image Haze Removal Using Dark Channel Prior。
简单说,就是从一张被雾笼罩的照片里,把雾"剥"掉,还原清晰的画面。方法的核心是他观察到:自然图像里几乎所有非天空的局部小块,总有至少一个像素的某个颜色通道是极暗的。雾把这层"暗"盖住了,他用这条规律反推雾的浓度,再减掉。
这篇论文拿到了2009年CVPR最佳论文奖。CVPR是计算机视觉的最高级别会议,最佳论文奖此前从未颁给华人,何恺明是第一个。
那时他还在读博。
2011年博士毕业,他直接留在MSRA做正式研究员。
ResNet:今天所有AI模型的底层
2015年,何恺明和同事孙剑、任少卿、张祥雨在MSRA做了一项工作,叫深度残差网络(ResNet)。
要理解ResNet重要在哪,先要知道一件事:2015年之前,神经网络做不深。
"深度学习"这个词里的"深",指的是网络层数多。理论上层数越多,AI越能学复杂任务。但实际训练时,层数一旦超过20层,网络就开始变差,准确率不升反降。整个领域卡在这里。
他们提出了一个简洁的办法:让每一层不要直接学新东西,而是学"在上一层基础上要改什么"。新一层学不到东西的时候,就把上一层原样传下去。
这个改动让神经网络第一次做到152层。当年的ImageNet图像识别比赛,ResNet拿了冠军,错误率比人眼还低。
2016年,这篇论文拿到CVPR最佳论文奖。这是何恺明人生中第二个CVPR最佳。
之后的十年,深度学习的每一次大爆发,都建立在ResNet之上。
AlphaGo Master 用ResNet看棋盘,就是战胜柯洁那个AI。
Transformer里的残差连接来自ResNet,而ChatGPT、Claude、Gemini的底层都是Transformer。
也就是说,如果没有何恺明他们的这篇论文,你可能现在还用不上这么智能的AI。
这篇论文今天的引用次数超过20万次。
Facebook:Mask R-CNN 和自监督学习
2016年8月,何恺明从微软跳槽到Facebook AI Research(FAIR)。
第二年,他和团队发表了Mask R-CNN。这个方法让AI同时识别图像里"这是什么"和"它在哪、轮廓是什么样"。论文拿到2017年ICCV最佳论文奖。ICCV和CVPR并列计算机视觉的最高级别会议。
之后几年,他陆续做了MoCo、MAE这些自监督学习的代表工作。简单说,就是让AI不需要人工标注数据,自己从海量图片里学东西。这套思路后来直接用在了大模型训练上。
2023年,ResNet的四位作者拿到未来科学大奖的"数学与计算机科学奖",百万美元奖金。
一年四个月拿下MIT终身教职
2024年2月,何恺明加入麻省理工学院(MIT)电气工程与计算机科学系,任副教授。从入职到拿终身教职(tenure),美国顶尖大学的工科教授通常要走六到七年。
他只用了1年4个月。
同时,他兼职加入Google DeepMind,担任杰出科学家。
到2026年,何恺明在Google Scholar上的总引用次数是54万。AI学界引用量排名前三,仅次于Yoshua Bengio和Geoffrey Hinton两位图灵奖得主。
以后你打开手机用AI,会不会想起他,何恺明,这位曾经高考满分的广州少年?