中国姑娘张楚晗,牛津VGG博士,拿下CVPR分量最重的最佳论文奖

中国姑娘张楚晗,牛津VGG博士,拿下CVPR分量最重的最佳论文奖

本文核心观点
今年6月,计算机视觉领域最顶尖的学术会议CVPR在美国丹佛召开。这一届投来一万六千多篇论文,录用四千多篇,最后评出的最佳论文,每年只有一到两篇。

中国姑娘张楚晗,牛津VGG博士,拿下CVPR分量最重的最佳论文奖

科技少年 | 感受他们的好奇与热爱

今年6月,计算机视觉领域最顶尖的学术会议CVPR在美国丹佛召开。这一届投来一万六千多篇论文,录用四千多篇,最后评出的最佳论文,每年只有一到两篇。

其中一篇的第一作者,是个中国姑娘,张楚晗

她的论文,让AI看一段普通视频就还原出会动的立体世界

给AI一段普通视频,比如你随手用手机拍的那种,它能算出画面里每样东西离镜头多远、每个点在三维空间里往哪儿动、拍的时候相机怎么移动,然后把这段平面视频还原成一个会动的立体场景。

这件事过去也能做,但要把好几个专门的模型拼在一起:一个测距离,一个算运动,一个估相机位置。又慢又容易出错,画面里只要有东西在动,结果就乱。张楚晗他们用一个模型把这些活全包了,对会动的和不动的东西一视同仁,还快了很多。光是估算相机位置这一步,就比过去快了上百倍,一块芯片几秒钟能处理一分钟的视频。

AR眼镜、电影特效、机器人认路,都得先让机器看懂眼前的立体世界。张楚晗他们这篇论文叫D4RT,做的就是这件最底下的事。

中国长大,高中去了英国,本科读的牛津工程

张楚晗在中国长大。高中阶段她去了英国,先在一所叫Kings的学校读衔接课程,再考进牛津大学的Exeter学院,读工程科学。她说那时候学校的老师特别愿意帮你,总有人能说上话,让她觉得像在家里一样。

牛津工程这个专业本硕连读,四年读下来拿的是硕士学位。读完她没走,留在牛津的VGG接着读博士。

VGG是牛津的视觉几何组,在计算机视觉圈里是块响当当的招牌。深度学习里有个家喻户晓的网络结构叫VGGNet,就出自这个组。读博期间,张楚晗就在CVPR发过论文。

她的导师Andrew Zisserman,是这个领域的奠基级人物。计算机视觉有个分量最重的论文奖叫Marr奖几十年里只有他一个人拿过三次。他是英国皇家学会院士,和人合写的《多视图几何》是这个领域几乎人手一本的教科书。

博士读完,她去了Google DeepMind

现在张楚晗是Google DeepMind的资深研究科学家。DeepMind是谷歌的AI研究机构,做出过下围棋赢了人类冠军的AlphaGo,还有能预测蛋白质结构、帮上无数生物学家的AlphaFold

这次拿最佳论文的D4RT,就是她在DeepMind做的。这篇论文有十四位作者,里面有她当年的博士导师Zisserman,也有DeepMind的几位资深科学家。

学生的名字排在第一个,老师的名字在后面。

微信二维码

扫码备注【NOAI】加交流群