中国姑娘张楚晗,牛津VGG博士,拿下CVPR分量最重的最佳论文奖
科技少年 | 感受他们的好奇与热爱
今年6月,计算机视觉领域最顶尖的学术会议CVPR在美国丹佛召开。这一届投来一万六千多篇论文,录用四千多篇,最后评出的最佳论文,每年只有一到两篇。
其中一篇的第一作者,是个中国姑娘,张楚晗。
她的论文,让AI看一段普通视频就还原出会动的立体世界
给AI一段普通视频,比如你随手用手机拍的那种,它能算出画面里每样东西离镜头多远、每个点在三维空间里往哪儿动、拍的时候相机怎么移动,然后把这段平面视频还原成一个会动的立体场景。
这件事过去也能做,但要把好几个专门的模型拼在一起:一个测距离,一个算运动,一个估相机位置。又慢又容易出错,画面里只要有东西在动,结果就乱。张楚晗他们用一个模型把这些活全包了,对会动的和不动的东西一视同仁,还快了很多。光是估算相机位置这一步,就比过去快了上百倍,一块芯片几秒钟能处理一分钟的视频。
AR眼镜、电影特效、机器人认路,都得先让机器看懂眼前的立体世界。张楚晗他们这篇论文叫D4RT,做的就是这件最底下的事。
中国长大,高中去了英国,本科读的牛津工程
张楚晗在中国长大。高中阶段她去了英国,先在一所叫Kings的学校读衔接课程,再考进牛津大学的Exeter学院,读工程科学。她说那时候学校的老师特别愿意帮你,总有人能说上话,让她觉得像在家里一样。
牛津工程这个专业本硕连读,四年读下来拿的是硕士学位。读完她没走,留在牛津的VGG接着读博士。
VGG是牛津的视觉几何组,在计算机视觉圈里是块响当当的招牌。深度学习里有个家喻户晓的网络结构叫VGGNet,就出自这个组。读博期间,张楚晗就在CVPR发过论文。
她的导师Andrew Zisserman,是这个领域的奠基级人物。计算机视觉有个分量最重的论文奖叫Marr奖,几十年里只有他一个人拿过三次。他是英国皇家学会院士,和人合写的《多视图几何》是这个领域几乎人手一本的教科书。
博士读完,她去了Google DeepMind
现在张楚晗是Google DeepMind的资深研究科学家。DeepMind是谷歌的AI研究机构,做出过下围棋赢了人类冠军的AlphaGo,还有能预测蛋白质结构、帮上无数生物学家的AlphaFold。
这次拿最佳论文的D4RT,就是她在DeepMind做的。这篇论文有十四位作者,里面有她当年的博士导师Zisserman,也有DeepMind的几位资深科学家。
学生的名字排在第一个,老师的名字在后面。