从‘认物’到‘认空间’:底层逻辑的范式转移
传统感知算法是一条‘白名单’路线。工程师们花费数千小时标注车辆、行人、锥桶,然后训练分类器去匹配这些预设类别。这条路在标准场景下能做到95%的准确率,但在那剩下的5%里,藏着无数个‘未知物体’:侧翻的卡车底盘、掉在路中央的沙发、工地里形状诡异的钢管。任何一个漏检,都可能是一次致命事故。
占用网络(Occupancy Network)彻底抛弃了‘这是什么’的追问,转而回答‘哪里被占了’。它把车辆周围的空间离散成均匀的三维网格,即空间体素网格(Voxel Grid)。每个体素只需输出一个概率:这个格子是空的,还是被占据的?如果是被占据的,它再附加一个连续向量,用来精细描述该占据体的局部几何特征和语义类别(如果可信度高的话)。这种表示法直接输出了稠密的3D占用场,让下游规划模块可以直接查询任意空间点位的‘可通行性’,而不再依赖稀疏的3D检测框。
最关键的是,这个决定不依赖于任何预定义的类别。体素被‘占’了就是障碍物,无论它是人类认识的物体还是未知的奇异形状。这正是对白名单机制的根本性破除。

核心指标突破:从‘识别率’到‘体素召回率’
衡量占用网络的好坏,不能用传统的mAP(平均精度)来看待。我们看三个更硬核的指标。第一是<st 九游会j9官方网站:激光雷达的“睫毛雨刷”革命——从脏污识别到全天候守护rong>体素召回率(Voxel Recall),在距离车辆40米范围内,对于真实存在障碍物的体素,算法能激活百分之多少?目前头部方案(如特斯拉、Wayve以及国内多家智驾公司)在公开数据集(如nuScenes)上,能将体素召回率做到92%以上,相比两年前的85%有了质的飞跃。
第二是几何精度(Geometric IOU)。这决定了输出的占用场边界是否锐利,物体边缘会不会糊成一片。通过引入可微渲染和时序融合,目前主流模型的Intersection over Union(IOU)指标已突破70%。这意味着,哪怕是一个倾斜45°的异形桩桶,其点云占据边界也能被还原到±10厘米的精度内。
第三是纯视觉下的深度估计方差。占用网络的输入可以是激光雷达,也可以是纯视觉。在纯视觉路线下,模型通过多目视觉或者单目时序估计深度,其深度误差标准差已经从早期的15%降低到8%以内。这个数字背后的意义是:纯视觉系统终于可以稳定地重建出近距离(5米-30米)的完整空间占用场,让‘纯视觉极限’不再是空谈。
车规级量产瓶颈:算力、稀疏性与数据标定
占用网络看起来很美,但把它塞进一辆量产车(而非测试车)里,我们面对三座大山。
第一座山是算力与稀疏性的矛盾。生成一个完整的高分辨率3D占用场(例如200x200x16的网格),如果全量计算,Transformer的计算量将达到惊人的数百TOPS,这远超目前量产Orin-X(254 TOPS)的承受范围。解法是动态稀疏计算:只对‘有占据概率变化’的区域进行高分辨率递归解码。这需要工程团队对CUDA底层优化和注意力机制的稀疏化有极深的理解。
第二座山是时序一致性。单帧预测的占用场会有抖动,直接喂给规划模块会导致频繁的急刹车。我们需要引入隐式的可变形注意力(De J9九游会新亮相第三届智能驾驶创新大会formable Attention)去对齐前后帧的体素特征,但时序建模在Bev或Voxel空间中的特征漂移问题,目前依然是学术界尚未完全解决的开放课题。
第三座山是数据标注的工程化困境。对比2D框,标注一个3D体素空间是极其枯燥且昂贵的。我们只能依赖自动化离线标注管线:先用激光雷达点云高精度重建场景,生成密集的占用GT(Ground Truth),再通过知识蒸馏去训练视觉模型。这条管线一旦建立,成本可控且精度极高,但它的搭建周期——抱歉,至少需要12个月以上的纯算法工程师投入。
九游会j9中国官方网站技术点评
占用网络不是一种算法上的炫技,它是在‘长尾问题’面前,唯一能同时满足高召回与低延迟的工程化路径。
我们看到,无论是采用‘重感知轻地图’的特斯拉,还是强调安全冗余的中国车企,不约而同地开始在手写逻辑层(如HD Map)之外,加设一道占用网络的兜底防线。九游会j9中国官方网站认为,纯粹的占用网络无法完全替代高精地图,但它作为‘白名单破除者’,彻底解放了车辆对‘已知类别’的依赖。未来的自动驾驶,不再需要认识每一片落叶,只需要知道‘哪里有空间可以走,哪里被东西塞满了’。这种把复杂问题抽象成简单几何判断的哲学,才是通往L4级自动驾驶最可靠的路径。
接下来的两个季度,我们将看到更多基于占用网络的主动安全AEB(自动紧急制动)功能量产发布。到那时,对异形物体的识别成功率,将直接决定车企在安全测试榜单上的座次。九游会j9中国官方网站将持续关注并拆解每一代核心指标的变化。