文章

无人机巡检视频流事件识别

安全帽、违停、入侵走二维视频,不依赖空三点云。全程 4K 逐帧推理通常不划算,整理航线门控、抽帧、检测与跟踪到事件的路线,发通知前须人审。

无人机巡检视频流事件识别

无人机巡检视频流事件识别

工程监理中的安全帽、违停、区域入侵依赖 二维照片或视频流,不要求空三生成点云。对全程 4K 视频逐帧推理会超出常规算力预算。本文整理航线门控、抽帧、检测、跟踪直至事件的常用技术路线。公开案例以厂商稿为准,监理发通知前须人审。

参考与延伸阅读:


目录


1. 安全巡视航线与建模航线

西安东站一类公开案例将机场 2 的测绘建模与安全巡视分为两条产线:每日定时起飞,司空 2 向建设、施工、监理多方直播,算法分析照片与视频流,截图连同位置推送地面处置。载荷可与建模共用机巢,但使用 不同航线(高度、角度及重点区域航线不同)。

1
2
3
4
每日定时起飞(照片和 / 或视频)
  → 云端直播
  → 算法分析照片与视频流
  → 截图 + 位置推送 → 地面处置

稿中实例包括违规进入施工区的人与车、未戴安全帽、工地违停车。

环节技术
直播图传与云端分享
人员 / 车辆目标检测(YOLO 类),可叠加跟踪
安全帽检测框内二次分类:有帽 / 无帽
违停车辆检测 + 禁停多边形(电子围栏)
区域入侵人 / 车检测 + 禁入区多边形

固定枪机更常用于安全帽识别;无人机适用于线性工地、禁停区、红线入侵等需要通视范围更大的面域。喊话器为可选负载,向地面人员推送并不属于检测算法本身。


2. 航片与视频的减量策略

常用策略为:控制采集量、抽样、先检出人员与车辆等大目标、再套业务规则、去重,最后人审。

巡检任务多用等间隔拍照或航点拍照(例如每 1~2 秒一张,或每个兴趣点一张),数据量比连续录像低一到两个数量级。必须录像时,推理仅使用关键帧(约 1~5 帧/秒),并丢弃模糊、过曝、纯天空帧。直播面向人员观看可保持连续画面;进入算法的仍是抽取后的帧。正射大幅影像应切块后再检测,避免将上万像素整图直接送入网络。

检测通常分为两级,而不是单模型覆盖全部业务:

1
2
3
4
5
6
抽帧 / 航片
  → 目标检测:人、车、机械(YOLO 类,工地俯视数据微调)
  → 安全帽:在人框内判断头部(有帽 / 无帽),或将安全帽作为检测类别
  → 违停 / 入侵:将车或人的落地点投到工地平面,判断是否位于禁停、禁入多边形
  → 跟踪与时空去重:同一目标连续多帧、同一坐标短时间内只生成一条事件
  → 人审队列 → 通过后推送工单 / 监理通知

违停的难点通常不在车辆识别,而在判断车辆是否停在禁止区域。需要电子围栏,并结合相机位姿(RTK、云台角)将像素投到地面,或在已知高度的正射上做点在多边形内判定。安全帽在数十米正射视角下目标很小、颜色易混淆,误报率高于枪机平视,因此重点区航线应降低高度并斜拍,而不是仅依赖一张高航高正射。


3. 航线与围栏门控

减量与航线绑定,门控优先依据飞机位置,而不是航点计划时刻前后若干秒。

航线可设置多个兴趣点(基坑、大门、钢筋场、禁停区),到达后才拍照、调整云台或开始录像;走廊飞行可以不采集,或采集后不进入模型。这是源头减量。

全程录像时仍应增加空间门控:每张图或每帧带有 RTK 或遥测经纬度,仅对落在工地多边形(或航点缓冲半径,例如 80 米)内的数据推理。以「航点计划时刻 ±30 秒」切分视频可作为粗滤,但风、悬停、复飞会使时刻漂移,同一航线在不同日期上的时间轴无法对齐。时间窗适合剔除起飞与返航段;进入模型的最终条件仍是坐标位于作业面,且高度、云台姿态合格。

线性工程(高速、轨道)通常将整条走廊视为作业面,门控为红线缓冲带,而不是若干孤立点。大门外商贩违停、便道占道若需纳入管理,应单独划定分析区。建模航线与巡检航线可以分开:前者保证重叠率,后者在兴趣点降低高度、斜拍并抽帧。


4. 视频流事件识别技术路线

抽帧与 YOLO 检测是主干,但只给出「当前帧是否存在人、车」。监理需要的是事件:时间、地点、未戴帽或违停,且同一目标不应重复报警。完整路线为抽帧 → 检测 → 跟踪 → 规则 → 事件,YOLO 仅占其中一环。

1
2
3
4
5
6
7
8
9
10
图传 / 录像(RTSP、厂商直播、落地文件)
  → 解码,并按时间戳对齐飞机位置、高度、云台角
  → 航线 / 围栏门控(不合格段丢弃)
  → 抽帧(约 1~5 fps)+ 模糊 / 过曝过滤
  → 目标检测(YOLO 类:人、车、机械)
  → 可选二级头:安全帽分类、反光衣等
  → 多目标跟踪(相邻帧的框关联为同一 ID)
  → 规则引擎:围栏内停留满 N 秒、连续 M 帧无帽、禁入区出现人
  → 生成事件(类型、时间、坐标、截图、置信度)并去重
  → 人审 → 工单 / 通知单
环节作用缺失时的后果
抽帧将 25/30 fps 降至可推理密度算力占用过高、重复框过多
YOLO 类检测给出类别与框后续规则缺少对象
跟踪跨帧维持 ID同一目标每帧生成新事件
规则将框转换为违停、入侵、未戴帽仅有检测结果,缺少业务含义
人审拦截误报水桶、路过车辆进入监理文件

安全帽可作为检测类别(person / helmet / no_helmet),也可先检人再对头部小图分类;工地俯视中后者往往更稳定。违停一般不单独训练「违停检测器」:先检出车辆,再根据跟踪轨迹是否在禁停多边形内停满设定时长(以区别驶过)。直播画面可以满帧;进入本流水线的始终是抽帧结果。视觉语言模型目前多用于复核或难例,主路径仍是检测、跟踪与规则,延迟和成本更可控。

与航片批处理的差异主要在前半段:视频需要解码、对齐遥测、在线抽帧;检测之后两条路径合流。


5. 算力部署与误报控制

机上小模型最多承担粗过滤或直播辅助;主力部署在机巢或工地边缘设备,或回传后由云端批处理。对当天航片落地后统一推理,比飞行过程中实时跟随 30 帧更常见、更稳定。平台交付宜为事件列表、截图与坐标,而不是原始视频。机上实时全类检测不是该场景的默认方案。

误报须作为一等风险:帽檐、水桶、车顶圆孔可能被识别为安全帽;路过车辆可能被识别为违停。监理文件必须人审。模型宜用本工地俯视样本微调,更换标段通常需要补充标注。标准文本还涉及钢筋间距、混凝土表观等,现场成熟度一般低于土方核算和安全大目标识别,宜试点而非作为唯一验收手段。


6. 小结

要点结论
减量控制采集、抽帧、航线与围栏门控,避免逐帧全量推理
门控以飞机坐标与姿态为准,时间窗仅作粗滤
事件抽帧、检测、跟踪、规则、人审;YOLO 只是其中一环
违停车辆检测加围栏与停留时间,不是单独的检测类别
交付事件列表与截图,而不是原始 4K 录像
本文由作者按照 CC BY 4.0 进行授权