AI 模型选型 · 更新于 2026-09-28

监控摄像头 AI 模型选型

室内 / 室外 / 特定场景的检测模型与管线选型,含许可证红线、端侧实测与边缘硬件对比。

场景选型矩阵

场景
属性(可多选)
场景首选模型/管线备选许可证浏览器端成熟度
室内·人员检测D-FINE-N / YOLO11nPP-PicoDet-S(极限小模型)、NanoDet-PlusApache / AGPL可实时成熟
室内·跌倒检测YOLO11n 检测 → RTMPose-t 姿态 → 30 帧滑窗规则/小型 ST-GCNMediaPipe BlazePose(最省事)Apache可行需工程化
室内·人脸门禁SCRFD-500MF 检测 + 自训 MobileFaceNet/ArcFace 识别RetinaFace-MobileNet0.25权重非商用,需自训可实时成熟
室内·婴儿/宠物YOLO11n 微调(COCO 自带猫狗类)+ YAMNet 哭声检测PP-PicoDet 微调Apache可实时需微调
室外·周界入侵D-FINE-N/S + ByteTrack(JS 可实现)+ 轨迹确认 N 帧OC-SORT(更轻)、BoT-SORT(带 ReID)Apache/MIT可实时成熟
室外·车牌识别HyperLPR3(检测+识别+分类一体,~15MB)PaddleOCR + 车牌检测自组管线Apache可实时成熟
室外·远距小目标D-FINE-S(AP_small 高)+ SAHI 切片思路(JS 裁图+跨片 NMS)YOLO12s(AP_small 29.8,AGPL)Apache需降分辨率/抽帧成熟
室外·夜视/低照度硬件补光/全彩夜视优先;模型侧 Zero-DCE++(10K 参数)作可关断前处理热成像 + YOLO 微调(FLIR 基线成熟)Zero-DCE 许可不明确可实时按场景取舍
工地·安全帽/反光衣D-FINE-N 在 SHWD/GDUT-HWD 自训(文献 mAP@0.5 90–96%)YOLO11n/s 微调Apache可实时成熟
火焰/烟雾D-FINE-N/YOLO11n + D-Fire 数据集微调 + 多帧时序投票DFS 数据集(含干扰类)Apache/CC0 数据可实时需微调+控误报
零售·客流统计人头检测(SCUT-HEAD/CrowdHuman 微调)+ ByteTrack 越线计数跨镜加 OSNet ReIDApache/MIT可实时成熟
电梯·电动车识别YOLO 检测电动车型 + 与轮椅/婴儿车区分的负样本训练中文开源数据集(2.8 万张级)Apache可实时成熟
庭院·野生动物MegaDetector v5/v6(人/动物/车三类)+ SpeciesNet 物种分类DeepFaune(欧洲物种)MIT/ApacheMegaDetector 偏大,建议抽帧成熟
高空抛物背景建模运动检测 + 落体轨迹拟合(FADE 数据集)检测模型辅助数据 CC BY-NC-SA需专用仰拍机位研究阶段
门口·包裹/遗留物检测 + 跟踪 + 时空规则(静止超时/包裹消失+陌生人)BoxMOT + OSNet 归属判定Apache/MIT可行需工程化

橙色为许可证需注意(AGPL / 权重非商用 / 未定义),商用部署前须核对。

检测模型横评 · YOLO 系(10 行)
模型机构/年份参数量COCO mAPT4 TRT 延迟ONNX 导出许可证备注
YOLOv8n / v8sUltralytics, 20233.2M / 11.2M37.3 / 44.91.47 / 2.66ms极易(一行 export)AGPL-3.0浏览器端验证最充分,benchmark 仓库最多
YOLOv10n / v10sTHU-MIG, 20242.3M / 7.2M38.5 / 46.31.84 / 2.49ms易,端到端无 NMSAGPL-3.0NMS-free,浏览器端后处理更省
YOLO11n / 11sUltralytics, 20242.6M / 9.4M39.5 / 47.01.50 / 2.50ms极易AGPL-3.0当前生态主力;CPU ONNX 11n 56.1ms
YOLO12n / 12sSUNY Buffalo 等, 20252.6M / 9.3M40.6 / 48.01.64 / 2.61ms易(opset≥17)AGPL-3.0Area Attention 精度最高;s 档 AP_small 29.8
YOLOv9t / v9sWongKinYiu, 20242.0M / 7.2M38.3 / 46.8—易GPL-3.0许可证最严格,商用回避
YOLO-NAS-SDeci, 2023未公布47.53.21ms中等权重非商用Deci 2024.4 被 NVIDIA 收购后停更,新项目别用
DAMO-YOLO-T/S阿里 tinyvision, 20228.5M / 16.3M43.0 / 46.82.78 / 3.83ms中等Apache-2.0仓库 2024 年后停更
PP-YOLOE+-t/s百度, 20224.9M / 7.9M39.9 / 43.72.84 / 2.62ms需 Paddle2ONNXApache-2.0PaddleDetection 持续维护
NanoDet-Plus-mRangiLyu, 20211.17M27.0@320 / 30.4@416ARM 12ms官方支持Apache-2.0INT8 仅 1.2MB;仓库 2024 年停更但足够稳
PP-PicoDet-S百度, 2021~1.0M29.1@320 / 32.5@416—Paddle2ONNXApache-2.0同量级精度优于 NanoDet,后处理可打进网络
检测模型横评 · DETR 系(端到端,Apache 阵营主力)(5 行)
模型机构/年份参数量COCO mAPT4 TRT 延迟ONNX 导出许可证浏览器端风险点
D-FINE-N / S中科大, 2024(ICLR'25 Spotlight)3.8M / 10M42.8 / 48.72.12 / 3.49ms官方 export_onnx.pyApache-2.0FDR 分布头算子细碎,暂无浏览器实测(不确定)
DEIM-N / SIntellindust-AI-Lab, 20244.0M / 10M43.0 / 49.02.12 / 3.49ms官方工具NOASSERTION*训练时间减半;同上
DEIMv2-Pico / Nano2025.9(DINOv3 骨干)1.5M / 3.6M38.5 / 43.0—官方工具Apache-2.0(以仓库为准)最新,生态验证少
RT-DETRv2-S百度, 2024(CVPR'24)20M47.94.59ms官方支持Apache-2.0query selection 的 TopK 在 WebGPU 无 kernel,会回退 CPU
RT-DETRv2-M / L同上31M / 42M49.9 / 53.46.40 / 9.15ms官方支持Apache-2.0模型 100MB+,建议服务器端
跌倒检测(老人看护)(3 行)
方案组成参数量浏览器端评价
两阶段管线(推荐)YOLO11n 检测 → RTMPose-t 关键点 → 30 帧滑窗规则(身体主轴倾角+髋部速度)或小型 ST-GCN 二分类3.34M(RTMPose-t)可行(RTMPose-t 骁龙865 ncnn 9ms,COCO 68.5 AP)泛化可控、误报可调;Apache-2.0
MediaPipe BlazePose / MoveNetGoogle 端侧姿态模型文件数 MB最省事(浏览器原生)Apache-2.0;精度略低于 RTMPose
端到端跌倒检测Le2i / UR Fall 上训练—不建议公开数据集仅百余段实验室演员视频,IEEE 研究明确指出真实监控场景泛化不可靠
人脸检测与识别(门禁 / 考勤)(3 行)
模型参数量关键指标许可证
SCRFD-500MF / 2.5G(检测)0.57M / 0.67MWiderFace Hard 68.5 / 77.9代码 MIT,权重非商用
RetinaFace-MobileNet0.25(检测)0.44MWiderFace Hard 47.3(VGA 单尺度)同上
buffalo_sc 识别(MobileFaceNet@WebFace600K)~1MIJB-C TAR@FAR=1e-4:95.02;LFW 99.70非商用
低光 / 逆光增强(3 行)
方案参数量开销结论
Zero-DCE++10KCPU 11 FPS / GPU 1000 FPS开销可忽略,可作可关断前处理;但对下游检测收益不确定
Retinexformer(ICCV'23)1.61M / 15.6G FLOPs中画质好但 Transformer 算子在 ORT Web 需实测,建议服务器端或仅报警帧启用
训练期低光增广(推荐)00用暗光/逆光增广直接微调检测器,IAT 等工作证明端到端优于"增强+检测"串联
远距离小目标(高处枪机)(4 行)
手段效果成本浏览器端可行性
SAHI 切片推理(MIT,5.5k★)VisDrone 上 FCOS/VFNet/TOOD 的 AP +5.1~6.8;切片+微调累计 +12.7~14.5推理次数 ×4~9JS 裁图 + 同一 ONNX 多次推理 + 跨片 NMS 即可复现,无需 SAHI 本体
D-FINE-S(AP 48.7,Objects365 预训练 50.7)当前 Apache 阵营小目标最强档之一—暂无浏览器实测
YOLO12s AP_small 29.8YOLO 系小目标最好—AGPL + 注意力开销
QueryDet(CVPR'22)VisDrone 26.2→28.3 AP,2.3~3× 加速Detectron2 依赖,无官方 ONNX仅服务器端研究
车牌识别(LPR / ANPR)(4 行)
方案组成/体积指标许可证评价
HyperLPR3(首选)检测(Y5RK)+识别(PPRCNN)+分类,~15MB官方口径:卡口场景 95–97%,720p 单核 CPU <100msApache-2.0ONNX 原生;注意使馆/港澳/双层车牌识别率低(官方自述);网传"99.2%"非官方口径,存疑
PaddleOCR + 车牌检测检测+识别各 ~10M 级CCPD 中文场景主流基线Apache-2.0可定制性强,生态 88.9k★
LPRNet(2018)~1.7M 参数(复现口径)论文中国车牌 ~95%复现多为 MIT轻但老,新项目直接用 HyperLPR3
OpenALPR—欧美牌为主,中文差AGPL 且停更近十年不推荐
夜视 / 无光环境(3 行)
路线关键数据结论
硬件:全彩夜视 / 补光 / 大光圈—第一优先级,模型增强的 PSNR 提升≠检测提升,且增加链路延迟
Zero-DCE++ 前处理10K 参数成本最低的软件方案,做成可关断开关
热成像 + YOLO 微调FLIR ADAS v2 官方基线 YOLOX-m:person AP50 75.3 / car 77.2无光环境(仓库、周界)已成熟,普通 YOLO 微调即可
多目标跟踪(越线 / 周界配套)(3 行)
跟踪器MOT17 test特点许可证浏览器端
ByteTrack(ECCV'22)80.3 MOTA / 77.3 IDF1高低分两阶段关联,简单鲁棒MIT纯 JS 可实现
BoT-SORT80.5 MOTA / 80.2 IDF1+相机运动补偿+ReID,身份保持最好MITReID 需 ONNX
OC-SORT78.0 MOTA / 77.5 IDF1无 ReID 最轻,关联 ~700 FPS CPUMIT纯 JS 可实现
特定场景(火焰烟雾 / 客流 / 电梯电动车)(7 行)
场景推荐技术路线开源资源成熟度预期难点
火焰/烟雾(仓库、车棚、森林)轻量检测器 + D-Fire 微调 + 多帧时序投票 + ROI 限定D-Fire(21,527 图,CC0)、DFS(9,462 图含干扰类)需微调夕阳/灯光/红色衣物误报;加不确定性后处理可将 precision 0.71→0.85
客流统计/热力(零售)人头检测 + ByteTrack 越线计数;热力=轨迹驻留叠加CrowdHuman(47 万实例)、SCUT-HEAD(11 万实例,HeadHunter F1≈0.94)成熟可用遮挡与双向判别;CSRNet 类密度图仅适合数百人极密场景,门店已被"检测+跟踪"取代
电梯电动车YOLO 检测 + 轮椅/婴儿车负样本 + 语音告警 + 梯控联动多套中文数据集(2.8 万张级)成熟可用数据质量参差;与轮椅混淆是主要误报源
高空抛物背景建模 + 落体轨迹拟合为主,检测模型为辅FADE 数据集(1881 视频/8 类,CC BY-NC-SA)+ FADE-Net研究阶段目标小且快、夜间蚊虫干扰;数据非商用;商用多为专用仰拍整机
口罩/工装/睡岗离岗口罩=3 分类检测;睡岗=人脸+PERCLOS 或 YOLO-pose 趴桌姿态+时序;离岗=人检测+ROI 缺席计时DAMO-YOLO-S 口罩镜像(ModelScope)等口罩成熟 / 工装睡岗需微调工装需自建数据;睡岗定义主观,需多特征融合
野生动物(庭院防兽)两阶段:MegaDetector(人/动物/车)+ SpeciesNet 物种分类MegaDetector v5/v6(跨场景 F1 0.87–0.96)、SpeciesNet(Google 2025.3 开源,~2500 类)成熟可用物种长尾与地区偏移;红外图像域偏移;SpeciesNet "94.5%"为官方宣称,第三方实测一致性约 85–90%
包裹/遗留物检测 + 跟踪 + 时空规则(静止超时/包裹消失+陌生人)AbandonedLuggageDetection、BoxMOT+OSNet 归属判定需工程化无成熟专用模型;"快递员即搬运者",恶意判定难
浏览器端推理实测(5 行)
环境模型实测来源可信度
RTX 3060 · Chrome WebGPUYOLOv8n@6408–21ms(47–120 FPS)中(两个来源不一致,取区间)
MacBook M1 · Safari WebGPUYOLOv8n@640~15ms中
M2/M3 级 · WebGPUYOLOv10-tiny40–50 FPS中
WASM(无 WebGPU 兜底)YOLOv8n约为 WebGPU 的 1/3~1/10中
iPhone(Safari < iOS 26 无 WebGPU)· WASMYOLOv8n200–400ms/帧中,仅够低频抽帧
浏览器端算子风险(3 行)
评级模型原因
✅ 无脑上YOLOv8 / 11 / v10 / v9(n、s 档)、PP-PicoDet、NanoDet-Plus、SCRFD、RTMPose、YAMNet纯卷积/标准算子,WebGPU 全覆盖,社区有现成 benchmark 验证
⚠️ 小心YOLOv12(opset 17 + 注意力开销)、RT-DETR(TopK 回退、R50 模型 100MB+、仅 transformers.js 实验性支持)、D-FINE/DEIM(Apache 首选但暂无浏览器实测,需自行验证)、YOLO-seg算子或体量有坑,需要先跑通再承诺
❌ 别碰含 RoiAlign 的两阶段模型、图内 NonMaxSuppression/EfficientNMS_TRT 导出、int8 QDQ 量化模型、移动端跑 m 档以上CPU 回退或直接失败
边缘硬件平台(4 行)
平台算力实测 FPS功耗成本适用
瑞芯微 RK3588(RKNN INT8)6 TOPS35–45(纯推理峰值 81)5–8W整机 ¥1000–2500多路 7×24 主力;可 8 路 1080P + v8n 20–25FPS/路
Hailo-8L + Pi513 TOPSv8s ~40 / v8n ~762–3.5W$70 + Pi5极致低功耗;编译器对部分算子(ViT LayerNorm 等)拒绝
Jetson Orin Nano—v8s FP16 ~35 / v8n TRT INT8 727–15W$249 套件需要跑大模型/ReID 的边缘服务器
浏览器 WebGPU(MiBeeNVR 路线)看用户 GPUv8n 47–120(桌面独显)0(复用用户机器)0零后端推理成本、隐私本地化的核心卖点
相关选购在淘宝查看「esp32s3 摄像头模块」的实时价格与现货去逛逛 →推广