Skip to content

Video Search Local让监控录像变得可理解、可检索

从实时视频流到带框事件录像,再到视觉大模型分析和自然语言搜索,一套可以本地部署的完整视频 AI 管线。

Video Search Local 标志

什么是 VSL?

VSL(Video Search Local)是一套面向监控摄像头的本地 AI 实时理解、事件记录与语义检索软件。 它接入 RTSP、RTMP、HLS 等视频流,在本地识别和跟踪人、车辆等目标;当目标满足用户设置的规则时,系统保存带检测框和目标 ID 的事件录像,再调用 API 视觉大模型生成摘要、行为、风险和关键词,最终把结果写入 SQLite 和 Qdrant。

用户无需逐段翻看录像,只需输入“查找有老人经过的画面”“寻找停车场里的车辆”之类的描述,即可检索并回看相关事件。

本地优先检测、跟踪和规则判断在设备本地完成
事件驱动只有规则命中后才录像并调用视觉 API
开放部署Go + React + Qdrant,Docker Compose 启动

VSL 如何工作?

01摄像头视频流RTSP、RTMP、HLS 等
02本地视觉推理YOLO26s / D-FINE-S
03跟踪与切片ByteTrack + 带框录像
04视觉大模型API 语义复核
05结构化存储SQLite + Qdrant
06自然语言检索查找并回看事件

这条流程把传统“只能回放”的监控视频,转换成包含时间、对象、稳定 ID、轨迹、活动、风险和自然语言摘要的结构化事件。详细的数据流和各组件职责见项目原理

产品界面

适合哪些场景?

  • 园区、仓库、门店和停车场的视频事件检索
  • 私有网络中的本地视频分析与事件留档
  • RTSP 摄像头、NVR 子码流或流媒体地址的 AI 验证
  • YOLO、ByteTrack、视觉大模型和向量数据库的完整工程示例
  • 在不把全部实时视频上传云端的前提下,引入 API 大模型分析

当前已经实现什么?

VSL 当前支持常见网络视频流、YOLO26s 与 D-FINE-S 检测、ByteTrack 跟踪、网页规则配置、带框事件录像、OpenAI 兼容视觉 API、DashScope 原生视频分析、SQLite 持久化任务队列以及 Qdrant 检索。CPU 和 NVIDIA CUDA 均可运行。

当前版本定位为单路视频流、单机单用户基础版,不包含人脸识别、跨摄像头 ReID、ONVIF 自动发现、GB28181 网关和音频分析。完整边界见常见问题

常见问题

VSL 必须使用 NVIDIA 显卡吗?

不必须。CPU 模式可用于功能验证和低帧率场景;持续实时分析建议使用 NVIDIA CUDA。模型、设备、推理帧率和线程数都可以在网页设置。

VSL 会上传全部监控视频吗?

不会。本地模型先完成检测、跟踪和规则判断。只有规则命中的事件片段,才会根据用户配置交给视觉大模型 API;API 失败也不会中断本地推理。

保存的视频带检测框吗?

带。事件录像、封面以及交给视觉大模型的画面均可包含半透明彩色遮罩、边框、类别、置信度和目标 ID。

VSL 是免费开源软件吗?

是。项目源代码采用 GNU AGPL-3.0 发布,可以查看、修改和自行部署;通过网络提供修改后的版本时,需要遵守 AGPL-3.0 的对应源代码义务。

开始使用

准备好 Docker 后,可以先阅读快速开始,或直接查看 GitHub 仓库

基于 AGPL-3.0 开源 · Built by WeCanCoding