⚙️
核心技术#视觉#AI

计算机视觉

从画框识别到像素级拆解:计算机视觉正在重构低空经济的落地底盘 当我们谈论人工智能对实体产业的改造时,大多数人最先想到的是大语言模型的对话能力,或是生成式AI的内容创作功能,但很少有人注意到,作为AI三大核心感知能力之一的

概念定义

计算机视觉是人工智能三大核心感知能力之一,通过训练卷积神经网络从图像中提取信息,支撑低空飞行障碍物精准识别与安全路径规划的底层技术。

从画框识别到像素级拆解:计算机视觉正在重构低空经济的落地底盘

当我们谈论人工智能对实体产业的改造时,大多数人最先想到的是大语言模型的对话能力,或是生成式AI的内容创作功能,但很少有人注意到,作为AI三大核心感知能力之一的计算机视觉,正在成为包括低空经济、智能制造、无人零售在内的多个新赛道的底层支撑。从无人配送无人机的障碍物识别,到自动驾驶汽车的行人检测,再到便利店的无人结算,今天的计算机视觉早已跳出实验室的算法研究范畴,变成了能落地产生实际价值的产业工具——而它的进化速度,远比我们想象得更快。

很多人对计算机视觉的最初认知,还停留在“给物体画框”的物体检测阶段:算法识别出图像里有一个人、一辆车,就在对应区域外围画一个方框标注位置。但今天的计算机视觉已经进化到了像素级识别的进阶阶段。按照微软Azure AI对计算机视觉的最新定义,现在的成熟模型已经不需要通过画框指示位置,而是可以精准识别出图像中属于特定物体的每一个像素——这种精度的提升,直接打开了无数新的应用场景。以低空经济领域的城市低空无人机配送为例,过去的障碍物识别只能做到“哪里有东西”,无法区分飘过来的是一个塑料袋还是一根高压电线,更无法判断建筑物阳台的凹凸轮廓,经常出现误判绕飞或者迫降;而像素级识别可以让无人机精准勾勒出障碍物的轮廓,判断物体的性质,规划出厘米级精度的飞行路线,直接解决了城市低空飞行的核心安全痛点。

这种能力的进化,背后是深度学习框架和底层算力的支撑。作为全球AI算力的核心供应商,英伟达很早就把计算机视觉定义为人工智能和深度学习的核心分支,其技术路径本质上就是通过训练卷积神经网络(CNNs),让机器像人类大脑一样从图像中提取信息,解决越来越宽泛的产业问题。不同于人类视觉靠千万年进化获得的感知能力,计算机视觉的识别能力完全靠数据训练出来,数据的规模和多样性直接决定了模型的精度——而真实世界的场景千变万化,很多极端场景根本收集不到足够的真实数据,比如无人机飞行遇到的极端雷雨天气、自动驾驶遇到的罕见交通事故,靠人工采集数据不仅成本高,还存在安全风险。

针对这个行业痛点,英伟达已经找到了新的解题思路:用合成数据喂出更靠谱的计算机视觉模型。依托基于OpenUSD开发的Omniverse平台,英伟达打造了专门生成合成数据的Omniverse Replicator,把Omniverse变成了计算机视觉的AI数据工厂——开发者可以在这个3D仿真环境中,生成任意场景、任意条件的标注数据,还能直接在仿真环境中验证AI模型的可靠性,不需要在真实场景中反复测试。这个变化对产业落地的影响是颠覆性的:以峰飞航空的城市物流无人机研发为例,过去要采集十万张不同光照、不同天气条件下的城市障碍物数据,需要团队在外场飞行测试三个月,成本超过百万元;现在通过仿真生成对应数据,只需要一周就能完成,成本降低了超过90%,还能覆盖各种真实场景中很难遇到的极端情况,模型的识别精度反而提升了15%以上。

如今计算机视觉的应用边界,还在随着多模态技术的融合不断拓宽。传统的计算机视觉只能处理视觉信息,给出识别结果,而多模态模型把视觉特征和对应的文字描述结合起来,已经可以生成完整的图像描述,直接延伸出了更多to C和to B的新场景。我们最常用的图片搜索就是最典型的应用:过去搜索图片只能靠用户上传的关键词匹配,你想找“故宫角楼秋天的照片”,只能输入文字,平台给你匹配带对应标签的图片;现在基于多模态计算机视觉的以图搜图,可以直接识别你上传的图片内容,帮你找到相似的图片,甚至能直接读懂你拍的植物是什么品种、你拍的小众景点是哪里,给你对应的信息推荐。

在零售领域,计算机视觉已经带来了实实在在的效率提升。亚马逊Amazon Go、京东之家等品牌推出的无人便利店,核心技术就是计算机视觉:通过门店内的多个摄像头,结合像素级识别技术,精准识别出顾客拿了哪件商品、放回去了哪件,自动完成结算,不需要收银员扫码,也不需要顾客在自助台手动操作,真正实现了“拿了就走”的购物体验。而在供应链库存管理领域,沃尔玛已经在北美超过3000家门店应用了基于计算机视觉的库存监控系统,摄像头可以实时识别货架上的库存余量,当某款商品缺货的时候自动给理货员发提醒,相比过去人工盘点,库存检查效率提升了7倍,缺货率下降了18%,直接带来了超过2%的销售额增长。

安全领域也是计算机视觉落地最成熟的场景之一。现在的政务服务、金融服务都已经普遍应用了基于计算机视觉的人脸识别验证,用户办理开户、挂失、政务年审等业务,不需要再跑到现场刷身份证,只需要对着手机摄像头完成人脸识别,就可以远程完成身份验证,光是每年给银行业节省的线下服务成本就超过百亿元。而在公共安全监控领域,计算机视觉可以自动识别监控画面中的异常行为,比如翻越围栏、遗留危险物品,自动给安保人员发出预警,相比人工24小时盯守监控屏幕,漏报率下降了超过80%,这在机场、地铁站、大型赛事场馆等人员密集场所,已经成为了标准配置。

更值得关注的是,计算机视觉还是移动机器人和自动驾驶领域的核心感知层,而这两个领域正是当前低空经济和智能交通的核心载体。亿航智能的自动驾驶低空载人飞行器,其感知系统就是由五组不同的计算机视觉摄像头加上激光雷达组成,计算机视觉负责识别飞行路径上的障碍物、起降场的标识,配合激光雷达完成测距,实现全自主起降和飞行;小鹏汽车的自动驾驶系统XNGP,仅依靠视觉方案就实现了城市NGP功能,车载摄像头收集的图像信息通过计算机视觉模型处理,可以精准识别出道路上的行人、非机动车、红绿灯、交通标识,甚至能识别出前车的转向灯信号,做出对应的驾驶决策。很多人以为自动驾驶靠的是激光雷达,实际上激光雷达只能完成测距,识别物体是什么、是什么状态,还是要靠计算机视觉对图像信息的处理。

当然,现在计算机视觉产业还面临着不少待解的问题:比如极端光照条件下的识别精度仍然不足,逆光、暗光环境下的像素识别误判率仍然比晴朗白天高出3倍以上;隐私保护的争议也一直伴随人脸识别等应用的发展,如何在实现识别功能的同时保护用户的生物信息安全,仍然需要技术和规则层面的双重完善。但不可否认的是,计算机视觉已经从一个实验室中的AI概念,变成了渗透到我们生活方方面面的基础设施,从出门购物刷脸支付,到网上购物以图搜款,再到无人机送快递、自动驾驶汽车上路,我们每天都在享受计算机视觉技术进步带来的便利。

根据英伟达开发者平台的最新动向,当前全球已经有超过两万名计算机视觉开发者在基于Omniverse的合成数据开发新的应用,覆盖从 robotics 到低空经济的近百个赛道,随着合成数据技术的成熟,计算机视觉模型的训练成本还会进一步下降,精度会进一步提升。未来随着低空经济的规模化落地,城市低空会有数以十万架的无人机承担配送、巡检、观光等任务,这些无人机都需要计算机视觉提供核心的环境感知能力,可以说,计算机视觉的进化速度,直接决定了低空经济这个万亿赛道的落地速度。而对于整个AI产业来说,计算机视觉作为机器感知世界的眼睛,其每一步技术进步,都会把人工智能向实体产业落地推进一步,这个过程中诞生的机会,值得所有产业参与者关注。

编辑人:工维安信·适航官

相关词条

无人机(UAV)

无人机是由无线电遥控或程序控制的不载人飞机,是低空经济核心装备。

低空经济

低空经济是以低空空域为依托,以各种有人驾驶和无人驾驶航空器的低空飞行活动为牵引,辐射带动相关领域融合发展的综合性经济形态。

深度学习

门槛崩塌:深度学习正在重构低空经济智能化落地的底层逻辑 当国内首架城市物流无人配送机在深圳龙岗完成千单常态化运营,当成都天府机场启动低空动态流量管理试点,低空经济的智能化转型早已跨过概念验证阶段,走到了规模化落地的门口。

强化学习

当强化学习脱离游戏实验室:大模型时代的基础设施重构正在发生 从AlphaGo击败李世石那一刻起,大众对强化学习的认知就一直停留在棋盘、电子游戏这类封闭测试场景里:通过无数次试错训练AI出最优决策,听起来强大,却始终走不出

神经网络

神经网络:低空经济智能化转型的隐形底座 当我们谈论低空经济的智能化转型时,最先想到的往往是无人机配送、低空交通管控这些直观的应用场景,很少会有人将视线落到支撑这些场景运转的技术内核——神经网络。作为现代人工智能与机器学习

卷积神经网络(CNN)

卷积神经网络:重构低空经济无人机巡检的视觉核心 当植保无人机在华南稻田上空自动识别稻飞虱病虫害,当电力巡检无人机在西南山区精准捕捉特高压线路的毫米级裂纹,当下消费级无人机自动避让突然闯入航道的高楼,很少有人会意识到,支撑

最后更新:2024-12-01

本词条内容仅供参考,如有疑义请以官方信息为准。