科学家团队

王利民,南京大学计算机学院教授、博士生导师

AI 2000人工智能全球具影响力学者,通用视频理解大模型InternVideo技术负责人

王利民
首席科学家
团队背景

南京大学计算机学院教授、博士生导师

AI 2000人工智能全球最具影响力学者,通用视频理解大模型InternVideo技术负责人

•研究领域为计算机视觉和多模态大模型,在IJCV、T-PAMI、CVPR、ICCV、NeurIPS等期刊和会议发表论文100余篇,谷歌学术引用5万余次,两篇一作论文引用超过 4000次。主持科技创新2030-"新一代人工智能"重大项目、江苏省自然科学基金攀登项目等
•带领团队研发了首个通用视频理解大模型体系InternVideo,全球用户下载量超过700万,被Google、Meta、NVIDIA等知名企业使用,产生了重要国际影响力
•曾获得广东省技术发明一等奖,蚂蚁 InTech科技奖,ACM MM 2023唯一最佳论文提名奖、首届世界人工智能大会青年优秀论文奖。担任CVPR/ICCV/NeurIPS等会议的领域主席和TPAMI/IJCV等期刊的编委
研究方向

InternVideo构建原生3D世界模型的基石

InternVideo能够从海量无监督视频中,原生提取关于三维空间的几何常识与物理规律(如重力、遮挡、深度、轨迹)。这种“原生3D几何感知”的注入,彻底消除了传统机械臂容易 “抓空、撞墙”的物理幻觉,为智增机器人重构了最扎实、最敏锐的“视听觉空间大脑基  层”

注:下图为2022年InternVideo 1.0版本的视觉底座架构,也是王利民教授团队针对视频基模型设计的高度创新的时空特征学习架构,是王教授 在如何用极低算力让大模型“看懂”三维物理世界时空轨迹这一关键科学问题上的奠基性回答。其中局部统一块 (Local UniBlockV2) 主要负责提取视频相邻帧之间的微小变化(如物体的连续位移、微表情等);全局统一块 (Global UniBlock V2)用于处理长时程的时空依赖关系(例如判断前后动作的因果、场景的宏观切换)

0519-61666669