张吕敏,苏大本科斯坦福博士,CV顶会最佳论文,ControlNet之父
AI人物 | 感受他们为世界做出的贡献
用AI画图,现在可以先丢一张线稿进去,或者拖一个火柴人摆好姿势,让模型照着这个结构画。
这个功能背后的技术叫ControlNet,2023年2月开源,代码放在GitHub上,到今天有34110个星。
做出它的人叫张吕敏,斯坦福大学计算机科学博士生。
ControlNet:把AI画画从碰运气变成照着画
ControlNet之前,用文字生成图片的模型只认文字。你把想要的画面写成一段话喂进去,模型给你一张图。人物站在哪、手往哪儿抬、镜头从什么角度看,都不归你管。想要某个特定的构图,只能反复改词、反复重新生成,直到碰上一张对的。
张吕敏的做法是给模型加一路额外的输入。除了文字,你还可以再给一张线稿、一副人体骨架、一张标出远近关系的图。模型按你给的结构去画,画风和内容仍旧听文字的。
他把原来那个训练好的大模型整个锁死不动,另外复制一份出来,专门学"按结构画"这件事。原模型的本事一点没损失,控制能力是另外训出来的。
论文2023年2月公开,同一个月代码就开源了。那年10月,计算机视觉的顶级会议ICCV在巴黎开会,投稿八千多篇,录用2160篇,最佳论文奖(Marr Prize)给了两篇,ControlNet是其中一篇。同一届拿到荣誉提名的,是Meta那篇很多人都知道的Segment Anything。
谷歌学术上,这篇论文的引用次数已经超过一万次。
苏州大学:本科阶段的七篇一作
张吕敏2021年从苏州大学拿到工学学士学位。
2018年到2021年,他以第一作者发出去的论文有七篇:两篇ACM TOG(图形学领域最顶级的期刊,分别在SIGGRAPH和SIGGRAPH Asia上发表),两篇ECCV,两篇CVPR,一篇ICCV。CVPR和ECCV跟ICCV并称计算机视觉三大顶会。这七篇里,一篇是ECCV的Spotlight,一篇是ICCV的口头报告,都是从录用论文里再挑一轮出来重点展示的。更早在2017年,他还有一篇一作论文发在ACPR上。
这些论文做的是同一类事:帮画画的人干活。线稿自动上色、把插画拆成漫画网点、给线稿加阴影、控制上色时颜色往哪儿蔓延、不串到旁边去。
合作者里有苏州大学计算机科学与技术学院的教授刘纯平,也有香港中文大学的Tien-Tsin Wong教授和早稻田大学的Edgar Simo-Serra。刘纯平做图像视频处理和计算机视觉,在CVPR、ECCV、ICCV、TOG上发表过八十多篇论文,2021年拿过吴文俊人工智能技术发明奖。
本科毕业后,张吕敏没有直接去美国。2021年他先到香港中文大学,在Tien-Tsin Wong的实验室做研究助理,2022年才进的斯坦福。
上大学以前:他在做游戏王的对战软件
他是个游戏开发者,也是游戏王卡牌的职业选手,做过一个叫YGOPro2的对战软件。
2017年6月,他把一个叫style2paints的工具传上GitHub。这个工具做的事很直白:你画好线稿,它自动上色。这个仓库现在有18171个星。
斯坦福:让普通电脑跑得动大模型
他在斯坦福的导师是Maneesh Agrawala,Forest Baskett讲席教授,同时是斯坦福Brown媒体创新研究所的主任,2009年拿过麦克阿瑟奖。
ControlNet之后,张吕敏做的东西集中在一件事上:让普通人的电脑也跑得动这些模型。
Fooocus是一个离线的开源出图软件,不需要手动调参数,从下载到出第一张图,鼠标点击次数不超过三次,最低4GB显存就能跑。这个项目有52938个星。
FramePack处理的是视频生成。它把已经生成的历史画面压缩成固定长度,于是做一分钟视频和做十秒视频的算力开销差不多,130亿参数的视频模型在笔记本电脑的显卡上就能跑起来。这个项目有17248个星。
他的GitHub账号有21532个人关注。中文圈里有人叫他敏神。
2026年1月到6月,他的名字出现在十一项被接收的工作上:两篇ICLR、一篇CVPR、一篇SIGGRAPH、两篇ICML、四篇ECCV、一篇UIST。
他的个人主页开头第一句是"如图1所示,张吕敏是斯坦福大学计算机科学博士生"。往上翻,图1是他自己的照片,图注写着:张吕敏终于把坏掉的烤箱修好了。
同一页上,他这样描述自己想做的事:
我喜欢直觉性的东西。我喜欢观察。我喜欢取舍。