无人机巡检视频流事件识别
安全帽、违停、入侵走二维视频,不依赖空三点云。全程 4K 逐帧推理通常不划算,整理航线门控、抽帧、检测与跟踪到事件的路线,发通知前须人审。
无人机巡检视频流事件识别
工程监理中的安全帽、违停、区域入侵依赖 二维照片或视频流,不要求空三生成点云。对全程 4K 视频逐帧推理会超出常规算力预算。本文整理航线门控、抽帧、检测、跟踪直至事件的常用技术路线。公开案例以厂商稿为准,监理发通知前须人审。
参考与延伸阅读:
- 大疆机场 2 智慧工地(西安东站安全检测):https://enterprise.dji.com/cn/news/detail/dock2-smart-site-modeling
- 泰伯网转载:https://www.taibo.cn/p/94831
- Ultralytics 文档:https://docs.ultralytics.com/zh/
目录
1. 安全巡视航线与建模航线
西安东站一类公开案例将机场 2 的测绘建模与安全巡视分为两条产线:每日定时起飞,司空 2 向建设、施工、监理多方直播,算法分析照片与视频流,截图连同位置推送地面处置。载荷可与建模共用机巢,但使用 不同航线(高度、角度及重点区域航线不同)。
1
2
3
4
每日定时起飞(照片和 / 或视频)
→ 云端直播
→ 算法分析照片与视频流
→ 截图 + 位置推送 → 地面处置
稿中实例包括违规进入施工区的人与车、未戴安全帽、工地违停车。
| 环节 | 技术 |
|---|---|
| 直播 | 图传与云端分享 |
| 人员 / 车辆 | 目标检测(YOLO 类),可叠加跟踪 |
| 安全帽 | 检测框内二次分类:有帽 / 无帽 |
| 违停 | 车辆检测 + 禁停多边形(电子围栏) |
| 区域入侵 | 人 / 车检测 + 禁入区多边形 |
固定枪机更常用于安全帽识别;无人机适用于线性工地、禁停区、红线入侵等需要通视范围更大的面域。喊话器为可选负载,向地面人员推送并不属于检测算法本身。
2. 航片与视频的减量策略
常用策略为:控制采集量、抽样、先检出人员与车辆等大目标、再套业务规则、去重,最后人审。
巡检任务多用等间隔拍照或航点拍照(例如每 1~2 秒一张,或每个兴趣点一张),数据量比连续录像低一到两个数量级。必须录像时,推理仅使用关键帧(约 1~5 帧/秒),并丢弃模糊、过曝、纯天空帧。直播面向人员观看可保持连续画面;进入算法的仍是抽取后的帧。正射大幅影像应切块后再检测,避免将上万像素整图直接送入网络。
检测通常分为两级,而不是单模型覆盖全部业务:
1
2
3
4
5
6
抽帧 / 航片
→ 目标检测:人、车、机械(YOLO 类,工地俯视数据微调)
→ 安全帽:在人框内判断头部(有帽 / 无帽),或将安全帽作为检测类别
→ 违停 / 入侵:将车或人的落地点投到工地平面,判断是否位于禁停、禁入多边形
→ 跟踪与时空去重:同一目标连续多帧、同一坐标短时间内只生成一条事件
→ 人审队列 → 通过后推送工单 / 监理通知
违停的难点通常不在车辆识别,而在判断车辆是否停在禁止区域。需要电子围栏,并结合相机位姿(RTK、云台角)将像素投到地面,或在已知高度的正射上做点在多边形内判定。安全帽在数十米正射视角下目标很小、颜色易混淆,误报率高于枪机平视,因此重点区航线应降低高度并斜拍,而不是仅依赖一张高航高正射。
3. 航线与围栏门控
减量与航线绑定,门控优先依据飞机位置,而不是航点计划时刻前后若干秒。
航线可设置多个兴趣点(基坑、大门、钢筋场、禁停区),到达后才拍照、调整云台或开始录像;走廊飞行可以不采集,或采集后不进入模型。这是源头减量。
全程录像时仍应增加空间门控:每张图或每帧带有 RTK 或遥测经纬度,仅对落在工地多边形(或航点缓冲半径,例如 80 米)内的数据推理。以「航点计划时刻 ±30 秒」切分视频可作为粗滤,但风、悬停、复飞会使时刻漂移,同一航线在不同日期上的时间轴无法对齐。时间窗适合剔除起飞与返航段;进入模型的最终条件仍是坐标位于作业面,且高度、云台姿态合格。
线性工程(高速、轨道)通常将整条走廊视为作业面,门控为红线缓冲带,而不是若干孤立点。大门外商贩违停、便道占道若需纳入管理,应单独划定分析区。建模航线与巡检航线可以分开:前者保证重叠率,后者在兴趣点降低高度、斜拍并抽帧。
4. 视频流事件识别技术路线
抽帧与 YOLO 检测是主干,但只给出「当前帧是否存在人、车」。监理需要的是事件:时间、地点、未戴帽或违停,且同一目标不应重复报警。完整路线为抽帧 → 检测 → 跟踪 → 规则 → 事件,YOLO 仅占其中一环。
1
2
3
4
5
6
7
8
9
10
图传 / 录像(RTSP、厂商直播、落地文件)
→ 解码,并按时间戳对齐飞机位置、高度、云台角
→ 航线 / 围栏门控(不合格段丢弃)
→ 抽帧(约 1~5 fps)+ 模糊 / 过曝过滤
→ 目标检测(YOLO 类:人、车、机械)
→ 可选二级头:安全帽分类、反光衣等
→ 多目标跟踪(相邻帧的框关联为同一 ID)
→ 规则引擎:围栏内停留满 N 秒、连续 M 帧无帽、禁入区出现人
→ 生成事件(类型、时间、坐标、截图、置信度)并去重
→ 人审 → 工单 / 通知单
| 环节 | 作用 | 缺失时的后果 |
|---|---|---|
| 抽帧 | 将 25/30 fps 降至可推理密度 | 算力占用过高、重复框过多 |
| YOLO 类检测 | 给出类别与框 | 后续规则缺少对象 |
| 跟踪 | 跨帧维持 ID | 同一目标每帧生成新事件 |
| 规则 | 将框转换为违停、入侵、未戴帽 | 仅有检测结果,缺少业务含义 |
| 人审 | 拦截误报 | 水桶、路过车辆进入监理文件 |
安全帽可作为检测类别(person / helmet / no_helmet),也可先检人再对头部小图分类;工地俯视中后者往往更稳定。违停一般不单独训练「违停检测器」:先检出车辆,再根据跟踪轨迹是否在禁停多边形内停满设定时长(以区别驶过)。直播画面可以满帧;进入本流水线的始终是抽帧结果。视觉语言模型目前多用于复核或难例,主路径仍是检测、跟踪与规则,延迟和成本更可控。
与航片批处理的差异主要在前半段:视频需要解码、对齐遥测、在线抽帧;检测之后两条路径合流。
5. 算力部署与误报控制
机上小模型最多承担粗过滤或直播辅助;主力部署在机巢或工地边缘设备,或回传后由云端批处理。对当天航片落地后统一推理,比飞行过程中实时跟随 30 帧更常见、更稳定。平台交付宜为事件列表、截图与坐标,而不是原始视频。机上实时全类检测不是该场景的默认方案。
误报须作为一等风险:帽檐、水桶、车顶圆孔可能被识别为安全帽;路过车辆可能被识别为违停。监理文件必须人审。模型宜用本工地俯视样本微调,更换标段通常需要补充标注。标准文本还涉及钢筋间距、混凝土表观等,现场成熟度一般低于土方核算和安全大目标识别,宜试点而非作为唯一验收手段。
6. 小结
| 要点 | 结论 |
|---|---|
| 减量 | 控制采集、抽帧、航线与围栏门控,避免逐帧全量推理 |
| 门控 | 以飞机坐标与姿态为准,时间窗仅作粗滤 |
| 事件 | 抽帧、检测、跟踪、规则、人审;YOLO 只是其中一环 |
| 违停 | 车辆检测加围栏与停留时间,不是单独的检测类别 |
| 交付 | 事件列表与截图,而不是原始 4K 录像 |
