近日,我院卢健老师团队成员,2024级控制科学与工程专业研究生王雯婧(三维点云表示学习方向)为第一作者的学术论文《PointMCF: Multi-Modal Conditioned Flow with Masked Point and Global Distribution for 3D Representation Learning》成功获国际多媒体领域顶级期刊IEEE Transactions on Multimedia(TMM,CCF-A,中科院大类一区TOP,IF=9.9)接收。TMM是 IEEE 旗下多媒体领域国际高水平学术期刊,主要刊载人工智能、计算机视觉、图像与视频处理、多模态学习、三维视觉及多媒体理解等方向的前沿研究成果,在国际多媒体与人工智能交叉研究领域具有较高的学术影响力。该成果的成功接收,进一步彰显了我校人工智能科创团队在人工智能与多媒体领域的持续科研实力和国际学术影响力。
在三维自监督表示学习领域,掩码点建模(Masked Point Modeling, MPM)和全局分布建模(Global Distribution Modeling, GDM)是两类具有较强泛化能力的主流方法。然而,MPM的随机掩码导致重建难度不均,GDM的噪声扰动又难以突出关键区域,同时现有方法对多模态信息的互补性挖掘不足。针对上述问题,本文提出 PointMCF 三维自监督表示学习框架,融合MPM与GDM的优势。通过引入跳跃式向量场(Leap-step Vector Field)刻画噪声到数据分布的动态演化,设计统一模态桥(Unified Modal Bridge)自适应融合图像、文本与点云信息,并利用由粗到细分组模块(Coarse-to-Fine Grouping Module)增强点云层次化特征建模能力。

图1 不同三维表示学习范式的综合比较

图2 PointMCF方法架构

图3可视化结果展示
该论文针对三维自监督表示学习中的关键问题,从表示建模、多模态融合和层次化特征学习等方面进行了创新,为提升三维数据理解能力提供了新的研究思路。
### 个人简介
1. 王雯婧,女,2024级控制科学与工程专业研究生,研究方向为三维点云表示学习。获IEEE Transactions on Multimedia(TMM)录用论文1篇,并参与合作发表 IEEE Transactions on Image Processing(TIP)和 IEEE Robotics and Automation Letters(RA-L)论文各1篇。
2. 卢健,男,控制工程系教师,研究方向为三维点云表示学习、行人重识别、行为识别等。近5年,以第一/通讯作者发表SCI检索期刊论文33篇,人工智能领域顶级国际会议 AAAI 论文1篇,以第一作者在《控制理论与应用》和《控制与决策》上发表论文5篇,一篇入选中国科协“科技期刊双语传播工程”。
2026年9月2日
(撰写:纪超,审核:李珣)