本地目标检测
使用 YOLO26s 或 D-FINE-S 在 CPU 或 NVIDIA CUDA 上完成实时目标检测。
VSL(Video Search Local)是一套面向监控摄像头的本地 AI 实时理解、事件记录与语义检索软件。 它接入 RTSP、RTMP、HLS 等视频流,在本地识别和跟踪人、车辆等目标;当目标满足用户设置的规则时,系统保存带检测框和目标 ID 的事件录像,再调用 API 视觉大模型生成摘要、行为、风险和关键词,最终把结果写入 SQLite 和 Qdrant。
用户无需逐段翻看录像,只需输入“查找有老人经过的画面”“寻找停车场里的车辆”之类的描述,即可检索并回看相关事件。
这条流程把传统“只能回放”的监控视频,转换成包含时间、对象、稳定 ID、轨迹、活动、风险和自然语言摘要的结构化事件。详细的数据流和各组件职责见项目原理。
VSL 当前支持常见网络视频流、YOLO26s 与 D-FINE-S 检测、ByteTrack 跟踪、网页规则配置、带框事件录像、OpenAI 兼容视觉 API、DashScope 原生视频分析、SQLite 持久化任务队列以及 Qdrant 检索。CPU 和 NVIDIA CUDA 均可运行。
当前版本定位为单路视频流、单机单用户基础版,不包含人脸识别、跨摄像头 ReID、ONVIF 自动发现、GB28181 网关和音频分析。完整边界见常见问题。
不必须。CPU 模式可用于功能验证和低帧率场景;持续实时分析建议使用 NVIDIA CUDA。模型、设备、推理帧率和线程数都可以在网页设置。
不会。本地模型先完成检测、跟踪和规则判断。只有规则命中的事件片段,才会根据用户配置交给视觉大模型 API;API 失败也不会中断本地推理。
带。事件录像、封面以及交给视觉大模型的画面均可包含半透明彩色遮罩、边框、类别、置信度和目标 ID。
是。项目源代码采用 GNU AGPL-3.0 发布,可以查看、修改和自行部署;通过网络提供修改后的版本时,需要遵守 AGPL-3.0 的对应源代码义务。