李沐,交大ACM班,CMU博士,全球500多所大学用他的书教深度学习
AI人物 | 感受他们为世界做出的贡献
70多个国家、500多所大学,在用同一本书教深度学习。
书名叫《动手学深度学习》,四位作者之一是李沐。
写这本书的时候,他在亚马逊做资深首席科学家。更早几年,他在读博士,做了一套叫"参数服务器"的东西。今天训练一个大模型,几千张显卡怎么分工、算完的结果怎么汇总,沿用的还是这套思路。
2004年,上海交大ACM班
李沐2004年考进上海交大,进了ACM班。
ACM班是俞勇老师2002年办的本科特班,从全校挑人,目标只有一句:培养科学家。这个班出过戴文渊,第四范式的创始人;也出过陈天奇,XGBoost的作者,现在是卡耐基梅隆大学(CMU)的助理教授,我们写过他。陈天奇是2006级,比李沐晚两届。
本科和硕士,李沐都在交大念的。2007年夏天他去微软亚洲研究院实习,2009到2010年在香港科技大学做研究助理,2011年4月进百度,当高级研究员。
2012年,去CMU读博的五年
2012年8月,李沐落地匹兹堡机场,进CMU读博士。
他同时跟着两位导师:Alex Smola做机器学习,Dave Andersen做分布式系统。这个组合决定了他后来做的所有事情:把算法和系统拼到一起。
读博第二年,他和一位做理论的同行合作,一篇关于矩阵近似的论文中了FOCS。FOCS是理论计算机科学的顶级会议,去那儿开会的基本都是做纯数学证明的人,跟他平时写系统代码是两拨人。
第三年,他和陈天奇几个人一起攒GPU集群,成立了DMLC。第四年,两个项目合并成了MXNet,一个深度学习框架,后来被亚马逊选作官方框架,也进了Apache基金会。
这五年他也没有一直待在学校。2013年夏天他去谷歌研究院实习,2014年4月到2015年12月回百度做首席架构师,那时博士还没读完。
影响最大的一项是参数服务器。2014年,这篇论文发表在OSDI上,他是第一作者。OSDI是计算机系统领域的顶级会议。
在那之前,模型一大就没法训练:一台机器装不下,几百台机器又没法协调。参数服务器解决的就是这件事,让成百上千台机器同时训练同一个模型,各算各的一部分,再把结果汇到一起。
五年博士读下来,他在FOCS、NIPS、KDD、OSDI四个会上都发过第一作者的论文。理论、机器学习、数据挖掘、计算机系统,平时是四拨不同的人在做。
2017年他答辩,委员会名单里有Jeff Dean(曾任谷歌首席科学家)。
《动手学深度学习》:写给要自己动手的人
博士毕业后,李沐进了亚马逊,一直做到资深首席科学家。中间他还在伯克利和斯坦福当过访问助理教授。
也是在这几年,他和另外三位作者写了《动手学深度学习》。
这本书的每一段理论后面都跟着一段能直接跑起来的代码,读者一边看一边动手。中文版2019年出版,英文版是剑桥大学出版社出的。开源仓库的简介上,官方写的是这么一句:
《动手学深度学习》:面向中文读者、能运行、可讨论。
这个仓库现在有8万多颗星。
配套的课他自己讲,放在B站,账号叫跟李沐学AI,185个视频,110万人关注。从深度学习入门一直讲到论文精读,一篇论文掰开揉碎讲一节,全部免费。2024年8月上海交大介绍他时,这个账号的粉丝还是80万。
2023年,跟自己的导师合伙创业
2023年2月,李沐从亚马逊离职,和Alex Smola一起创办了Boson AI。Smola当CEO,他当CTO。这是师徒俩第二次合伙,读博期间他们就办过一家公司,后来被收购了。
Boson AI做语音和数字人。2026年5月,他们发布了Higgs Avatar v1:给一张静态照片配上一段声音,就能实时生成一张会说话、会听、会回应的脸,每一帧都是当场算出来的。一张H100显卡能同时跑8路对话。
在上海交大的一次演讲里,他说过自己怎么看工作、读博和创业这三件事:
工作的话,我今天的工作明天就能得到肯定;读phD的话,需要三年,我才能得到学术成果。创业,我需要更耐心的等待。