AI 模型选型 · 更新于 2026-09-28
监控摄像头 AI 模型选型
室内 / 室外 / 特定场景的检测模型与管线选型,含许可证红线、端侧实测与边缘硬件对比。
场景选型矩阵
场景
属性(可多选)
| 场景 | 首选模型/管线 | 备选 | 许可证 | 浏览器端 | 成熟度 |
|---|---|---|---|---|---|
| 室内·人员检测 | D-FINE-N / YOLO11n | PP-PicoDet-S(极限小模型)、NanoDet-Plus | Apache / AGPL | 可实时 | 成熟 |
| 室内·跌倒检测 | YOLO11n 检测 → RTMPose-t 姿态 → 30 帧滑窗规则/小型 ST-GCN | MediaPipe BlazePose(最省事) | Apache | 可行 | 需工程化 |
| 室内·人脸门禁 | SCRFD-500MF 检测 + 自训 MobileFaceNet/ArcFace 识别 | RetinaFace-MobileNet0.25 | 权重非商用,需自训 | 可实时 | 成熟 |
| 室内·婴儿/宠物 | YOLO11n 微调(COCO 自带猫狗类)+ YAMNet 哭声检测 | PP-PicoDet 微调 | Apache | 可实时 | 需微调 |
| 室外·周界入侵 | D-FINE-N/S + ByteTrack(JS 可实现)+ 轨迹确认 N 帧 | OC-SORT(更轻)、BoT-SORT(带 ReID) | Apache/MIT | 可实时 | 成熟 |
| 室外·车牌识别 | HyperLPR3(检测+识别+分类一体,~15MB) | PaddleOCR + 车牌检测自组管线 | Apache | 可实时 | 成熟 |
| 室外·远距小目标 | D-FINE-S(AP_small 高)+ SAHI 切片思路(JS 裁图+跨片 NMS) | YOLO12s(AP_small 29.8,AGPL) | Apache | 需降分辨率/抽帧 | 成熟 |
| 室外·夜视/低照度 | 硬件补光/全彩夜视优先;模型侧 Zero-DCE++(10K 参数)作可关断前处理 | 热成像 + YOLO 微调(FLIR 基线成熟) | Zero-DCE 许可不明确 | 可实时 | 按场景取舍 |
| 工地·安全帽/反光衣 | D-FINE-N 在 SHWD/GDUT-HWD 自训(文献 mAP@0.5 90–96%) | YOLO11n/s 微调 | Apache | 可实时 | 成熟 |
| 火焰/烟雾 | D-FINE-N/YOLO11n + D-Fire 数据集微调 + 多帧时序投票 | DFS 数据集(含干扰类) | Apache/CC0 数据 | 可实时 | 需微调+控误报 |
| 零售·客流统计 | 人头检测(SCUT-HEAD/CrowdHuman 微调)+ ByteTrack 越线计数 | 跨镜加 OSNet ReID | Apache/MIT | 可实时 | 成熟 |
| 电梯·电动车识别 | YOLO 检测电动车型 + 与轮椅/婴儿车区分的负样本训练 | 中文开源数据集(2.8 万张级) | Apache | 可实时 | 成熟 |
| 庭院·野生动物 | MegaDetector v5/v6(人/动物/车三类)+ SpeciesNet 物种分类 | DeepFaune(欧洲物种) | MIT/Apache | MegaDetector 偏大,建议抽帧 | 成熟 |
| 高空抛物 | 背景建模运动检测 + 落体轨迹拟合(FADE 数据集) | 检测模型辅助 | 数据 CC BY-NC-SA | 需专用仰拍机位 | 研究阶段 |
| 门口·包裹/遗留物 | 检测 + 跟踪 + 时空规则(静止超时/包裹消失+陌生人) | BoxMOT + OSNet 归属判定 | Apache/MIT | 可行 | 需工程化 |
橙色为许可证需注意(AGPL / 权重非商用 / 未定义),商用部署前须核对。
检测模型横评 · YOLO 系(10 行)
| 模型 | 机构/年份 | 参数量 | COCO mAP | T4 TRT 延迟 | ONNX 导出 | 许可证 | 备注 |
|---|---|---|---|---|---|---|---|
| YOLOv8n / v8s | Ultralytics, 2023 | 3.2M / 11.2M | 37.3 / 44.9 | 1.47 / 2.66ms | 极易(一行 export) | AGPL-3.0 | 浏览器端验证最充分,benchmark 仓库最多 |
| YOLOv10n / v10s | THU-MIG, 2024 | 2.3M / 7.2M | 38.5 / 46.3 | 1.84 / 2.49ms | 易,端到端无 NMS | AGPL-3.0 | NMS-free,浏览器端后处理更省 |
| YOLO11n / 11s | Ultralytics, 2024 | 2.6M / 9.4M | 39.5 / 47.0 | 1.50 / 2.50ms | 极易 | AGPL-3.0 | 当前生态主力;CPU ONNX 11n 56.1ms |
| YOLO12n / 12s | SUNY Buffalo 等, 2025 | 2.6M / 9.3M | 40.6 / 48.0 | 1.64 / 2.61ms | 易(opset≥17) | AGPL-3.0 | Area Attention 精度最高;s 档 AP_small 29.8 |
| YOLOv9t / v9s | WongKinYiu, 2024 | 2.0M / 7.2M | 38.3 / 46.8 | — | 易 | GPL-3.0 | 许可证最严格,商用回避 |
| YOLO-NAS-S | Deci, 2023 | 未公布 | 47.5 | 3.21ms | 中等 | 权重非商用 | Deci 2024.4 被 NVIDIA 收购后停更,新项目别用 |
| DAMO-YOLO-T/S | 阿里 tinyvision, 2022 | 8.5M / 16.3M | 43.0 / 46.8 | 2.78 / 3.83ms | 中等 | Apache-2.0 | 仓库 2024 年后停更 |
| PP-YOLOE+-t/s | 百度, 2022 | 4.9M / 7.9M | 39.9 / 43.7 | 2.84 / 2.62ms | 需 Paddle2ONNX | Apache-2.0 | PaddleDetection 持续维护 |
| NanoDet-Plus-m | RangiLyu, 2021 | 1.17M | 27.0@320 / 30.4@416 | ARM 12ms | 官方支持 | Apache-2.0 | INT8 仅 1.2MB;仓库 2024 年停更但足够稳 |
| PP-PicoDet-S | 百度, 2021 | ~1.0M | 29.1@320 / 32.5@416 | — | Paddle2ONNX | Apache-2.0 | 同量级精度优于 NanoDet,后处理可打进网络 |
检测模型横评 · DETR 系(端到端,Apache 阵营主力)(5 行)
| 模型 | 机构/年份 | 参数量 | COCO mAP | T4 TRT 延迟 | ONNX 导出 | 许可证 | 浏览器端风险点 |
|---|---|---|---|---|---|---|---|
| D-FINE-N / S | 中科大, 2024(ICLR'25 Spotlight) | 3.8M / 10M | 42.8 / 48.7 | 2.12 / 3.49ms | 官方 export_onnx.py | Apache-2.0 | FDR 分布头算子细碎,暂无浏览器实测(不确定) |
| DEIM-N / S | Intellindust-AI-Lab, 2024 | 4.0M / 10M | 43.0 / 49.0 | 2.12 / 3.49ms | 官方工具 | NOASSERTION* | 训练时间减半;同上 |
| DEIMv2-Pico / Nano | 2025.9(DINOv3 骨干) | 1.5M / 3.6M | 38.5 / 43.0 | — | 官方工具 | Apache-2.0(以仓库为准) | 最新,生态验证少 |
| RT-DETRv2-S | 百度, 2024(CVPR'24) | 20M | 47.9 | 4.59ms | 官方支持 | Apache-2.0 | query selection 的 TopK 在 WebGPU 无 kernel,会回退 CPU |
| RT-DETRv2-M / L | 同上 | 31M / 42M | 49.9 / 53.4 | 6.40 / 9.15ms | 官方支持 | Apache-2.0 | 模型 100MB+,建议服务器端 |
跌倒检测(老人看护)(3 行)
| 方案 | 组成 | 参数量 | 浏览器端 | 评价 |
|---|---|---|---|---|
| 两阶段管线(推荐) | YOLO11n 检测 → RTMPose-t 关键点 → 30 帧滑窗规则(身体主轴倾角+髋部速度)或小型 ST-GCN 二分类 | 3.34M(RTMPose-t) | 可行(RTMPose-t 骁龙865 ncnn 9ms,COCO 68.5 AP) | 泛化可控、误报可调;Apache-2.0 |
| MediaPipe BlazePose / MoveNet | Google 端侧姿态 | 模型文件数 MB | 最省事(浏览器原生) | Apache-2.0;精度略低于 RTMPose |
| 端到端跌倒检测 | Le2i / UR Fall 上训练 | — | 不建议 | 公开数据集仅百余段实验室演员视频,IEEE 研究明确指出真实监控场景泛化不可靠 |
人脸检测与识别(门禁 / 考勤)(3 行)
| 模型 | 参数量 | 关键指标 | 许可证 |
|---|---|---|---|
| SCRFD-500MF / 2.5G(检测) | 0.57M / 0.67M | WiderFace Hard 68.5 / 77.9 | 代码 MIT,权重非商用 |
| RetinaFace-MobileNet0.25(检测) | 0.44M | WiderFace Hard 47.3(VGA 单尺度) | 同上 |
| buffalo_sc 识别(MobileFaceNet@WebFace600K) | ~1M | IJB-C TAR@FAR=1e-4:95.02;LFW 99.70 | 非商用 |
低光 / 逆光增强(3 行)
| 方案 | 参数量 | 开销 | 结论 |
|---|---|---|---|
| Zero-DCE++ | 10K | CPU 11 FPS / GPU 1000 FPS | 开销可忽略,可作可关断前处理;但对下游检测收益不确定 |
| Retinexformer(ICCV'23) | 1.61M / 15.6G FLOPs | 中 | 画质好但 Transformer 算子在 ORT Web 需实测,建议服务器端或仅报警帧启用 |
| 训练期低光增广(推荐) | 0 | 0 | 用暗光/逆光增广直接微调检测器,IAT 等工作证明端到端优于"增强+检测"串联 |
远距离小目标(高处枪机)(4 行)
| 手段 | 效果 | 成本 | 浏览器端可行性 |
|---|---|---|---|
| SAHI 切片推理(MIT,5.5k★) | VisDrone 上 FCOS/VFNet/TOOD 的 AP +5.1~6.8;切片+微调累计 +12.7~14.5 | 推理次数 ×4~9 | JS 裁图 + 同一 ONNX 多次推理 + 跨片 NMS 即可复现,无需 SAHI 本体 |
| D-FINE-S(AP 48.7,Objects365 预训练 50.7) | 当前 Apache 阵营小目标最强档之一 | — | 暂无浏览器实测 |
| YOLO12s AP_small 29.8 | YOLO 系小目标最好 | — | AGPL + 注意力开销 |
| QueryDet(CVPR'22) | VisDrone 26.2→28.3 AP,2.3~3× 加速 | Detectron2 依赖,无官方 ONNX | 仅服务器端研究 |
车牌识别(LPR / ANPR)(4 行)
| 方案 | 组成/体积 | 指标 | 许可证 | 评价 |
|---|---|---|---|---|
| HyperLPR3(首选) | 检测(Y5RK)+识别(PPRCNN)+分类,~15MB | 官方口径:卡口场景 95–97%,720p 单核 CPU <100ms | Apache-2.0 | ONNX 原生;注意使馆/港澳/双层车牌识别率低(官方自述);网传"99.2%"非官方口径,存疑 |
| PaddleOCR + 车牌检测 | 检测+识别各 ~10M 级 | CCPD 中文场景主流基线 | Apache-2.0 | 可定制性强,生态 88.9k★ |
| LPRNet(2018) | ~1.7M 参数(复现口径) | 论文中国车牌 ~95% | 复现多为 MIT | 轻但老,新项目直接用 HyperLPR3 |
| OpenALPR | — | 欧美牌为主,中文差 | AGPL 且停更近十年 | 不推荐 |
夜视 / 无光环境(3 行)
| 路线 | 关键数据 | 结论 |
|---|---|---|
| 硬件:全彩夜视 / 补光 / 大光圈 | — | 第一优先级,模型增强的 PSNR 提升≠检测提升,且增加链路延迟 |
| Zero-DCE++ 前处理 | 10K 参数 | 成本最低的软件方案,做成可关断开关 |
| 热成像 + YOLO 微调 | FLIR ADAS v2 官方基线 YOLOX-m:person AP50 75.3 / car 77.2 | 无光环境(仓库、周界)已成熟,普通 YOLO 微调即可 |
多目标跟踪(越线 / 周界配套)(3 行)
| 跟踪器 | MOT17 test | 特点 | 许可证 | 浏览器端 |
|---|---|---|---|---|
| ByteTrack(ECCV'22) | 80.3 MOTA / 77.3 IDF1 | 高低分两阶段关联,简单鲁棒 | MIT | 纯 JS 可实现 |
| BoT-SORT | 80.5 MOTA / 80.2 IDF1 | +相机运动补偿+ReID,身份保持最好 | MIT | ReID 需 ONNX |
| OC-SORT | 78.0 MOTA / 77.5 IDF1 | 无 ReID 最轻,关联 ~700 FPS CPU | MIT | 纯 JS 可实现 |
特定场景(火焰烟雾 / 客流 / 电梯电动车)(7 行)
| 场景 | 推荐技术路线 | 开源资源 | 成熟度 | 预期难点 |
|---|---|---|---|---|
| 火焰/烟雾(仓库、车棚、森林) | 轻量检测器 + D-Fire 微调 + 多帧时序投票 + ROI 限定 | D-Fire(21,527 图,CC0)、DFS(9,462 图含干扰类) | 需微调 | 夕阳/灯光/红色衣物误报;加不确定性后处理可将 precision 0.71→0.85 |
| 客流统计/热力(零售) | 人头检测 + ByteTrack 越线计数;热力=轨迹驻留叠加 | CrowdHuman(47 万实例)、SCUT-HEAD(11 万实例,HeadHunter F1≈0.94) | 成熟可用 | 遮挡与双向判别;CSRNet 类密度图仅适合数百人极密场景,门店已被"检测+跟踪"取代 |
| 电梯电动车 | YOLO 检测 + 轮椅/婴儿车负样本 + 语音告警 + 梯控联动 | 多套中文数据集(2.8 万张级) | 成熟可用 | 数据质量参差;与轮椅混淆是主要误报源 |
| 高空抛物 | 背景建模 + 落体轨迹拟合为主,检测模型为辅 | FADE 数据集(1881 视频/8 类,CC BY-NC-SA)+ FADE-Net | 研究阶段 | 目标小且快、夜间蚊虫干扰;数据非商用;商用多为专用仰拍整机 |
| 口罩/工装/睡岗离岗 | 口罩=3 分类检测;睡岗=人脸+PERCLOS 或 YOLO-pose 趴桌姿态+时序;离岗=人检测+ROI 缺席计时 | DAMO-YOLO-S 口罩镜像(ModelScope)等 | 口罩成熟 / 工装睡岗需微调 | 工装需自建数据;睡岗定义主观,需多特征融合 |
| 野生动物(庭院防兽) | 两阶段:MegaDetector(人/动物/车)+ SpeciesNet 物种分类 | MegaDetector v5/v6(跨场景 F1 0.87–0.96)、SpeciesNet(Google 2025.3 开源,~2500 类) | 成熟可用 | 物种长尾与地区偏移;红外图像域偏移;SpeciesNet "94.5%"为官方宣称,第三方实测一致性约 85–90% |
| 包裹/遗留物 | 检测 + 跟踪 + 时空规则(静止超时/包裹消失+陌生人) | AbandonedLuggageDetection、BoxMOT+OSNet 归属判定 | 需工程化 | 无成熟专用模型;"快递员即搬运者",恶意判定难 |
浏览器端推理实测(5 行)
| 环境 | 模型 | 实测 | 来源可信度 |
|---|---|---|---|
| RTX 3060 · Chrome WebGPU | YOLOv8n@640 | 8–21ms(47–120 FPS) | 中(两个来源不一致,取区间) |
| MacBook M1 · Safari WebGPU | YOLOv8n@640 | ~15ms | 中 |
| M2/M3 级 · WebGPU | YOLOv10-tiny | 40–50 FPS | 中 |
| WASM(无 WebGPU 兜底) | YOLOv8n | 约为 WebGPU 的 1/3~1/10 | 中 |
| iPhone(Safari < iOS 26 无 WebGPU)· WASM | YOLOv8n | 200–400ms/帧 | 中,仅够低频抽帧 |
浏览器端算子风险(3 行)
| 评级 | 模型 | 原因 |
|---|---|---|
| ✅ 无脑上 | YOLOv8 / 11 / v10 / v9(n、s 档)、PP-PicoDet、NanoDet-Plus、SCRFD、RTMPose、YAMNet | 纯卷积/标准算子,WebGPU 全覆盖,社区有现成 benchmark 验证 |
| ⚠️ 小心 | YOLOv12(opset 17 + 注意力开销)、RT-DETR(TopK 回退、R50 模型 100MB+、仅 transformers.js 实验性支持)、D-FINE/DEIM(Apache 首选但暂无浏览器实测,需自行验证)、YOLO-seg | 算子或体量有坑,需要先跑通再承诺 |
| ❌ 别碰 | 含 RoiAlign 的两阶段模型、图内 NonMaxSuppression/EfficientNMS_TRT 导出、int8 QDQ 量化模型、移动端跑 m 档以上 | CPU 回退或直接失败 |
边缘硬件平台(4 行)
| 平台 | 算力 | 实测 FPS | 功耗 | 成本 | 适用 |
|---|---|---|---|---|---|
| 瑞芯微 RK3588(RKNN INT8) | 6 TOPS | 35–45(纯推理峰值 81) | 5–8W | 整机 ¥1000–2500 | 多路 7×24 主力;可 8 路 1080P + v8n 20–25FPS/路 |
| Hailo-8L + Pi5 | 13 TOPS | v8s ~40 / v8n ~76 | 2–3.5W | $70 + Pi5 | 极致低功耗;编译器对部分算子(ViT LayerNorm 等)拒绝 |
| Jetson Orin Nano | — | v8s FP16 ~35 / v8n TRT INT8 72 | 7–15W | $249 套件 | 需要跑大模型/ReID 的边缘服务器 |
| 浏览器 WebGPU(MiBeeNVR 路线) | 看用户 GPU | v8n 47–120(桌面独显) | 0(复用用户机器) | 0 | 零后端推理成本、隐私本地化的核心卖点 |