Tổng quan FPT AI Vision Agents
FPT AI Vision Agents là nền tảng phân tích video thông minh do FPT AI - FPT Smart Cloud phát triển, giúp doanh nghiệp khai thác dữ liệu từ hệ thống camera hiện có để tự động hoá giám sát, phân tích hành vi và tối ưu vận hành. Nền tảng sử dụng các mô hình AI chạy trên hạ tầng GPU của FPT Cloud để xử lý luồng video theo thời gian thực hoặc theo sự kiện.
Nền tảng được thiết kế theo kiến trúc microservice, hỗ trợ multi-tenant, triển khai linh hoạt từ vài camera đến hàng trăm camera tại nhiều địa điểm.
Các khái niệm chính
| Khái niệm | Ý nghĩa |
|---|---|
| Organization (Tổ chức) | Đơn vị quản lý cấp cao nhất, đại diện cho một doanh nghiệp hoặc chuỗi cửa hàng. Chứa nhiều Location. |
| Location (Địa điểm) | Một vị trí vật lý (nhà hàng, cửa hàng, văn phòng). Liên kết với mã thiết bị VMS để đồng bộ camera. |
| Camera | Thiết bị camera IP được quản lý trong hệ thống. Thuộc một Location, có thể được gán nhiều Task AI. |
| Task (Tác vụ AI) | C ấu hình phân tích cụ thể gán cho camera (ví dụ: đếm người, kiểm tra cuộc họp). Có lịch trình, vùng ROI, và nguồn dữ liệu riêng. |
| Event (Sự kiện) | Kết quả phân tích do AI Engine tạo ra (phát hiện khuôn mặt, phát hiện cuộc họp...). |
| Alert (Cảnh báo) | Thông báo khi phát hiện tình huống cần chú ý (camera mất kết nối, chất lượng stream kém...). |
| ROI (Region of Interest) | Vùng quan tâm vẽ trên khung hình camera, giới hạn vùng AI phân tích. |
| VMS | Hệ thống quản lý video (của FPT hoặc bên thứ ba) cung cấp danh sách camera và URL stream cho nền tảng. |
Các tính năng chính
- Cảnh báo và giám sát camera: phát hiện freeze/black screen, chẩn đoán sức khoẻ camera định kỳ, đẩy cảnh báo thời gian thực qua SSE.
- Báo cáo và phân tích: báo cáo lưu lượng khách hàng, hiện diện khách hàng, kiểm tra cuộc họp đầu ca — đều xuất được CSV.
- Ghi hình và lưu trữ: ghi hình theo lịch trình, lưu trữ trên Object Storage (mã hoá H.265).
Các bài toán đã triển khai
- Đếm và theo dõi khách hàng: nhận diện khuôn mặt để đếm lưu lượng ra/vào và thời gian hiện diện.
- Kiểm tra cuộc họp đầu ca: dùng VLM để phân loại cuộc họp đúng giờ/trễ/không tổ chức, lưu ảnh bằng chứng.
- Kiểm tra vùng giới hạn: phát hiện người xâm nhập khu vực hạn chế, cảnh báo thời gian thực.
Kiến trúc hệ thống
Hệ thống gồm các thành phần chính sau, phối hợp qua message broker để xử lý bất đồng bộ:
| Thành phần | Vai trò |
|---|---|
| Platform Backend | REST API quản lý tổ chức/địa điểm/camera/task/event/alert; điều phối luồng dữ liệu, xác thực và phân quyền. |
| Platform Frontend | Giao diện web quản trị (Camera AI Portal) — xem Tổng quan Camera AI Portal. |
| Stream Gateway | Xử lý stream camera (tối đa 32 stream/instance), phát hiện lỗi chất lượng stream, hỗ trợ horizontal scaling. |
| Recording Worker | Ghi hình từ luồng trực tiếp hoặc từ video lưu trữ. |
| DeepStream Engine | Pipeline AI trên GPU, xử lý multi-stream, sinh metadata cho báo cáo và cảnh báo. |
| Video Event Worker | Xử lý phát hiện sự kiện theo pipeline: chunk video → trích xuất frame → AI inference → rules engine. |
Platform Backend lên lịch ghi hình → Recording Worker ghi và lưu segment lên storage → Platform Backend đưa segment vào hàng đợi phân tích → AI Worker (DeepStream hoặc Video Event) xử lý và trả kết quả về Platform Backend.
Bước tiếp theo
- Mới bắt đầu? Xem Bắt đầu sử dụng Vision Agents.
- Đã có tài khoản? Xem Tổng quan Camera AI Portal để làm quen giao diện.
- Cần hỗ trợ nhanh? Xem Câu hỏi thường gặp.