灵波科技发布LingBot-Depth 2.0空间感知模型:数据量扩至1.5亿,深度误差减半

蚂蚁集团旗下灵波科技发布空间感知模型LingBot-Depth 2.0,训练数据从300万扩至1.5亿,深度误差减半;同步推出视觉基座模型LingBot-Vision,开源4个版本。

7月7日,蚂蚁集团(Ant Group)旗下具身智能公司灵波科技(LingBot Technology)推出新一代空间感知模型LingBot-Depth 2.0。该模型基于1.5亿规模数据训练,相比上一代300万数据量提升50倍,在深度补全基准的16项测评中获得12项第一,室内大面积深度缺失场景的误差从RMSE 0.132降至0.062,降幅超过50%。同时,灵波科技还发布了视觉基座模型LingBot-Vision,构建起机器人从“看懂”到“看准”的能力链路。

灵波科技发布LingBot-Depth 2.0空间感知模型:数据量扩至1.5亿,深度误差减半

核心升级:数据驱动与性能跃升

LingBot-Depth 2.0是灵波科技自研的空间感知模型,旨在为机器人提供物理世界的“眼睛”。其前代产品LingBot-Depth 1.0已解决了透明、反光等复杂场景的感知难题,2.0版本则在数据规模和算法上实现全面升级。

训练数据从1.0版本的300万张图像扩展至1.5亿张,这使得模型能学习更丰富的场景特征,在边缘清晰度、细小物体识别、远距离深度估计以及复杂光照、材质场景下的鲁棒性方面取得显著进步。在深度补全基准测试中,LingBot-Depth 2.0在16项测评中拿下12项第一。最困难的是室内大面积深度缺失场景,其均方根误差(RMSE)从上一代的0.132降低至0.062,误差直接减半。在玻璃、镜面、透明物体等传统深度相机容易失效的场景中,模型能补全出完整、平整的三维结构,表现尤为突出。

LingBot-Depth 2.0已通过奥比中光(Orbbec)深度视觉实验室的专业认证。实际测试基于奥比中光Gemini 330系列双目3D相机提供的芯片级3D原始数据,结果显示模型在边缘清晰度、物体轮廓完整性、细小物体识别等多个维度均有明显提升。

视觉基座:LingBot-Vision的创新预训练范式

与LingBot-Depth 2.0同步推出的还有视觉基座模型LingBot-Vision。这是一款通用视觉模型,也是业内首个将“边界结构”作为预训练目标的视觉基础模型,实现了空间感知训练范式的突破。

传统视觉预训练多关注图像分类、对比学习等任务,而LingBot-Vision直接以物体边界和空间结构作为学习目标,具备亚像素级的边界定位与空间结构理解能力。其预训练语料仅为1.6亿张图像,比主流模型DINOv3的数据集小一个数量级,但深度估计精度优于DINOv3。

此外,LingBot-Vision对物体边界的判定足够稳定,能在视频中连续追踪物体边界,这对机器人在动态环境中感知至关重要。该模型开源了4个版本——ViT-G/L/B/S,覆盖不同计算需求,方便研究者和开发者选用。LingBot-Vision除了支撑LingBot-Depth 2.0训练外,还具备“一模多用”能力,可迁移至物体检测、分割等下游任务。

实际验证与行业意义

LingBot-Depth 2.0的合作评测方奥比中光是国内领先的3D传感解决方案提供商,其Gemini 330系列双目3D相机能提供高精度芯片级3D原始数据。评测结果显示,该模型在多型号传感器的实际场景中表现优异,尤其在边缘清晰度、物体轮廓完整性、细小物体识别、远距离深度估计及复杂场景鲁棒性方面均有明显提升,为在工业、服务、物流等领域的应用奠定了基础。

灵波科技是蚂蚁集团旗下的具身智能公司,此次发布展示了其在机器人视觉领域的技术积累。具身智能机器人需要在真实世界中完成抓取、导航、交互等任务,而空间感知是基础能力。LingBot-Depth 2.0通过数据驱动和模型优化有效克服了传统深度相机在玻璃、镜面、透明物体前的失效问题,为机器人提供了更可靠的环境感知能力。

名词解释: 空间感知模型:指能够对三维空间中的物体位置、形状、深度等信息进行感知和理解的AI模型,是机器人视觉的核心组成部分。 深度补全:利用算法对深度传感器获取的不完整深度数据(如缺失、空洞区域)进行填充和优化的技术,旨在恢复完整的深度信息。 视觉基础模型:经过大规模数据预训练、可适应多种下游视觉任务(如检测、分割、深度估计)的通用视觉神经网络模型。

参考来源:量子位、灵波科技官方发布

本文参考来源:量子位

核心要点

7月7日,蚂蚁集团(Ant Group)旗下具身智能公司灵波科技(LingBot Technology)推出新一代空间感知模型LingBot-Depth 2.0



微信扫描下方的二维码阅读本文

灵波科技发布LingBot-Depth 2.0空间感知模型:数据量扩至1.5亿,深度误差减半 - LingBot-Depth 2.0, LingBot-Vision, 具身智能, 深度估计, 灵波科技, 空间感知模型, 蚂蚁集团, 视觉基础模型

发表回复