徐梦迪,非计算机专业,2025年毕业就当上清华助理教授,今年又做姚班班主任
AI人物 | 感受他们为世界做出的贡献
2026年8月19日,清华紫荆C楼,交叉信息研究院在这里迎接姚班的新生。当晚是二招宣讲会,四位新生班主任轮流上台,讲各自在做的研究。
讲人工智能方向的那位老师叫徐梦迪,交叉信息研究院助理教授,2025年9月才入职。她那晚的题目是"构建下一代智能"。
姚班全称计算机科学实验班,姚期智2005年创办,2022年之后下设计算机科学、人工智能、量子信息三个方向。今年这四位班主任,一位做机器学习理论和AI对齐,一位做电子游戏研发和多模态生成,一位做离子量子计算,徐梦迪的方向是机器学习、机器人学、人机交互和AI安全。
她本科学的是车辆工程。
从车辆工程到机器人
2017年,徐梦迪从清华车辆工程专业本科毕业,接着去约翰斯·霍普金斯大学读机器人学硕士,导师是Gregory Chirikjian。之后到卡内基梅隆大学读博士,进的是那里的安全AI实验室(Safe AI Lab),负责人Ding Zhao,实验室做机器人学习、强化学习和AI安全。2024年博士毕业,拿的是机械工程学位。
读博期间的三个夏天她都在外面:2021年丰田研究院,2022年MIT-IBM Watson AI实验室,2023年谷歌DeepMind机器人团队。
2024年6月,她进斯坦福视觉与学习实验室做博士后,合作的两位教授是吴佳俊和李飞飞。一年多之后,2025年9月,她回了本科母校,进交叉信息研究院。
让机械臂拿锤子把牛奶盒勾过来
机械臂够不到桌子那头的牛奶盒,它抄起旁边的锤子,用锤头把盒子钩到手边。四足机器人过不去两张沙发之间的空隙,它把周围的东西搬过来搭出一条路。还有一次,它用一个滚筒和一块冲浪板搭成杠杆。
这些动作出自RoboTool。2023年徐梦迪和CMU、谷歌DeepMind的研究者一起做了这个系统,她是共同一作。以前让机器人干活,得一步步告诉它用哪件工具、做哪个动作。RoboTool拿到的只有三样:任务目标、场景里有什么东西、机器人自己能做什么。剩下的分析限制条件、挑工具、排步骤、写出能直接执行的代码,由系统自己完成,背后跑的是GPT-4。
她跟《Tech Xplore》讲过为什么要做这件事,开头引的是心理学家苛勒二十世纪初那组猿类实验:
工具使用常被看作高级智能的标志。苛勒的实验里,猿把箱子叠起来,够到挂在高处、原本够不着的香蕉;食蟹猴用石头砸开坚果和贝壳。按工具本来的用途、照既定的步骤去用是一回事;用不常规的方式去用,解法更灵活,但对认知能力的要求高得多。
博士论文:只把模型做大不够
大模型这几年给出的经验是,参数、数据、算力一起往上堆,很多没专门训练过的能力会自己出现。机器人领域不少人想把这条路复制过来。
徐梦迪的博士论文叫《构建可适应的通用机器人》,她在里面问的是:模型足够大、数据足够多,泛化能力就会自然出现吗?
她的答案是不够。真实世界的任务几乎无限,训练集装不下机器人以后会碰上的所有情况。与其指望训练集覆盖一切,不如让机器人到了现场,靠少量新信息快速调整。她把这个能力叫适应。光把模型做大不行,还得加上这一条。
论文写了三条路,其中一条是2022年发在ICML上的Prompting Decision Transformer。今天大家熟悉的上下文学习,是给大模型几个例子,它自己看出规律,不用重新训练参数。她把"例子"换成一小段演示:机器人当时处在什么状态、做了什么动作、拿到多少回报。模型看完就知道眼前是什么任务。没见过的目标方向、速度和位置,靠这一小段就能应付,参数一个都不用改。
2024年,这篇博士论文拿了CMU机械工程系当年的最佳博士论文奖。
回清华的第一年
2025年秋天她在清华开了一门课,Interactive AI。课题组现在有三个博士生。实验室招人列的方向有五个:机器人硬件设计、大规模模型训练、机器学习、控制、机器人学。
2026年2月,她的团队放出CoVer-VLA。VLA是视觉语言动作模型,看画面、听一句话、动手,都在一个模型里。麻烦出在中间:人说的和机器人做的经常对不上。CoVer-VLA让机器人动手之前先生成好几组候选指令和动作,再用一个验证器挑出最贴合人话的那一组。同样的数据,与其接着把策略模型练得更大,不如把"验证"这道工序做厚:在SIMPLER仿真基准上提升22%,真机实验里提升45%。
她给实验室定的目标是三个词:scalable、adaptable、reliable。能扩展,能适应,可靠。
迎新那晚讲完"构建下一代智能",她请台下的新生秉持刨根问底的精神,一起定义智能的下一站。