央视网消息:2026年,具身智能行业正陷入一场关于数据的竞赛。百万小时采集计划成为头部厂商标配,数采硬件密集发布,开源数据集接连涌现。行业共识是:谁先获取到更多的数据,谁就能训练出更大的模型。可行业目前真正缺少的,不只是更多数据,而是具备真实尺度、稳定时空关系、并能高效进入训练与推理流程的高质量空间数据。因此在这场竞赛中,一个关键问题正在被重新审视——什么样的"机器人之眼"才能采集到真正高质量的空间数据?
多传感器融合方案的边界

目前,主流厂商普遍采用多传感器融合方案,远距离感知交给以dToF为核心的激光雷达类传感器,近距离操作交给高精度深度相机。两套系统覆盖机器人的"远"和"近"、导航与操作,是当前工程上最成熟的方案之一。
但从原理上,这种方案绕不开三个问题:
视差——多个传感器物理位置不同,后端融合存在对齐误差;
时间同步——不同传感器采样频率不同,拼在一起的世界模型存在"时间差";
材质盲区——高反光金属、透明玻璃、薄膜等材质,传统感知方案难以有效采集数据。
这三个问题并非算法优化可以完全解决,而是"先成像、后计算"技术路线自带的物理局限。
新路线:"超越融合"
2026年8月,时空张量机器人在2026世界机器人大会上全球首发其核心产品:7D空间智能视觉传感器"天眼·Tensopt"。
该产品所采用的技术路线与主流多传感器融合方案存在本质差异。时空张量提出了"基于高时间分辨的空间计算智能成像"方案,核心理念为:先计算,后成像。
具体实现上,该方案采用自研的"一路双光"光路架构——即一条物理光路配合一枚传感器,同时实现空间距离感知与二维语义感知。纳秒级脉冲激光负责测距与三维重建,皮秒级时序同步与单光子级门控成像负责高清可视化感知,照明与成像在同一时刻、同一光路中完成。
时空张量的7D空间智能相机则将传统摄像机的工作流程逆向重构,在光子到达传感器之前即开始计算。"一路"指硬件架构形态,"双光"指功能分工,同时具备测距与二维彩色成像能力。该方案不依赖多传感器硬件拼接,从物理层面消除了多传感器融合中的视差与时间同步问题。
全光函数七维合一
在光学领域,一条完整的光线需要7个维度来描述,即计算机视觉领域所称的"全光函数"。时空张量将这7个维度集成于一枚传感器:X/Y/Z三维坐标、RGB语义信息、时间戳,并叠加脉冲飞行时间测距功能。
传统方案需要将摄像头、激光雷达、毫米波雷达等多种传感器组合使用,而时空张量的空间智能相机仅需一台设备、一条光路、一个物理信号,即可实现感知统一。
在机器人应用场景中,该产品的关键参数包括:感知量程0.15m至30m,近距离达毫米级精度,中远距离达厘米级精度。单台设备可同时覆盖远距离导航避障与近距离精细操作需求,相当于将目前行业主流方案中导航感知与操作感知两套系统的功能集成于一体。原生输出超过3000万点/秒的超稠密点云,相比主流方案原生点云密度有显著提升。点云密度越高,物理世界的空间几何关系与语义属性还原越精确。全分辨率下实现25Hz实时空间点云生成,而行业主流方案目前全分辨率空间点云生成速度为10Hz。内置AI算力,可直接通过计算成像输出深度信息与彩色点云,无需依赖外部算力资源,而主流方案需借助外部算力方能完成成像处理。
高反光与高透明场景的感知突破
在家庭服务场景中,机器人进入厨房面对玻璃杯、透明保鲜膜、不锈钢器皿等传统视觉难以有效感知的物体时,该产品通过对空间光场占用率的直接测量,不依赖物体表面反射特性,可对透明玻璃、高反光金属、纯白墙面、微光暗环境等传统深度相机和激光雷达难以有效感知的边缘场景实现完整的点云重建。
在精密装配场景中,3C电子产线手机主板插件间隙小于0.1mm,机械臂末端需达到微米级定位精度。传统视觉方案在高反光焊点、金属引脚等场景下精度下降明显,影响产品良率。该产品以毫米级空间定位精度和每秒超3000万点的点云密度,为机器人的手眼协同提供了高精度数据支撑,时空张量团队将其概括为"最后一毫米"。
在物流分拣场景中,电商仓库内包裹形态各异、堆叠无序,透明胶带封口的纸箱、亮面包装袋、异形软包等传统视觉需大量样本训练,遇到透明材质时识别效果受限。该产品凭借超稠密点云还原完整的空间几何关系。
在户外作业场景中,配送机器人在强光、眩光、逆光环境下穿行,传统摄像头易出现过曝,激光雷达信号可能衰减。该产品抗干扰能力达100KLux,在单一光路内完成照明与成像,不受环境光变化干扰。
这些场景的共同特点在于:它们均属于传统多传感器融合方案难以有效处理的复杂感知场景,而该产品从物理原理层面绕开了这些问题。据介绍,该方案在实际应用中可帮助客户减少2至3个传感器,标定成本降低60%以上,SLAM精度提升3倍。
“先计算,后成像”的时代潜力
机器人视觉的技术路线在2025至2026年间迎来实质性分化,背后的驱动因素主要有三点:
第一,视觉-语言-动作(VLA)端到端模型的爆发,对视觉输入端的感知质量提出了更高要求。Google的RT-2、Physical Intelligence的π0、智元的Gen e Envisioner等模型将视觉、语言与动作控制进行端到端融合。模型能力越强,对输入端数据质量的要求越高。
第二,多传感器融合路线在工程层面已接近物理极限。主流方案将同步精度做到1毫秒以内,继续提升的空间有限。
第三,机器人应用场景正从专用走向通用,对视觉系统的要求从"满足特定场景"升级为"适应全场景"。工业分拣、精密装配、物流搬运、家庭服务等场景对视觉系统的要求各不相同,但均无法容忍感知盲区的存在。
这三重因素叠加,使"先计算、后成像"这一此前相对小众的技术路线开始获得更广泛的行业关注。
行业观察
回到开头那个问题:具身智能"数据竞赛"的上限,到底在哪儿?
当机器人的眼睛能够天然输出具备真实尺度、稳定时空关系、并能高效进入训练与推理流程的7D空间数据,行业所追逐的"百万小时高质量数据",将不再依赖事后融合与人工清洗,而是在源头以"物理级正确"的方式被生产出来。"天眼"所感知的数据具备连贯、完整、统一的时空属性,无需繁琐的标定、对齐与融合算法,为行业提供了通往物理AI世界的基础设施。
"一路双光"、空间光切片、计算成像,这些技术的本质,是为机器人量身定义一种不同于人类视觉的感知方式。同一束光,在同一个光路里,同时完成照明、成像、测距、三维重建,没有视差,没有时差,没有盲区。
央视网科技将持续关注具身智能感知技术的发展与演进。
正在阅读:具身智能数据竞赛升级,机器人之眼成行业竞争新焦点