RK3588 NPU 实战:6TOPS 算力能跑什么模型?部署与性能优化指南
RK3588 的 NPU 标称 6TOPS(INT8),是它区别于普通应用处理器最重要的一项能力。但「6TOPS 能跑什么」这个问题,答案取决于模型、精度和路数三者的组合。本文结合实战经验给出可落地的判断标准。
一、NPU 基础规格
| 项目 | 规格 |
|---|---|
| 算力 | 6 TOPS @ INT8(3 核 NPU,可独立调度) |
| 支持精度 | INT4 / INT8 / INT16 / FP16 |
| 算子支持 | 卷积、深度卷积、池化、全连接、常见激活与后处理 |
| 工具链 | RKNN-Toolkit2(PC 端转换)+ RKNPU2 SDK(板端推理) |
注意「3 核」这个特性:三核可以并行跑不同模型或分摊同一模型,合理调度能显著提升多任务吞吐。
二、6TOPS 到底能跑多少
先给结论性的经验值(1080P 输入、INT8 量化、单核利用率约 70% 估算):
| 模型类型 | 典型帧率 | 说明 |
|---|---|---|
| YOLOv5s / YOLOv8s | 约 30~60 FPS | 最常用组合,多路视频分析主力 |
| YOLOv8m | 约 15~25 FPS | 精度更高,适合单路高精度场景 |
| 轻量分类(MobileNet 级) | 数百 FPS | 可多路并行 |
| 人脸检测+识别 | 约 20~40 FPS | 搭配检测模型串行 |
| 姿态估计(轻量) | 约 20~30 FPS | 行为分析类项目 |
| 小参数量大模型(如 0.5B~1.5B INT4) | 每秒数 token ~ 十几 token | 端侧问答可跑,速度有限 |
换句话说:做多路视频智能分析(如 8~16 路 1080P 的检测)RK3588 是够用的;跑大语言模型属于「能跑但别期望快」,适合离线或轻交互场景。
三、RKNN 部署流程
- 模型准备:PyTorch / ONNX 模型导出为 ONNX(注意自定义算子需替换或改写)。
- 模型转换:在 PC 上用 RKNN-Toolkit2 载入 ONNX,配置量化数据集(建议 100~500 张真实场景图)。
- 量化:优先 INT8;若精度掉得多,可对敏感层保留 FP16(混合量化)。
- 板端推理:用 RKNPU2(C/C++ API 或 Python)在板子上加载 .rknn 模型,配合 V4L2/RTSP 取流。
- 零拷贝:让摄像头数据直接进入 NPU 输入内存(DMA-BUF),避免多次内存拷贝,这是提速最明显的一步。
四、性能优化要点
- 输入分辨率别贪大:640×640 通常是检测模型的最佳平衡点,1080P 直接推理往往得不偿失。
- 善用三核:多路视频时把不同路分派到不同 NPU 核,或对单模型做多核协同(RKNN 支持)。
- 减少 CPU 后处理:NMS 等后处理如果留在 CPU,容易成为瓶颈,可用 NPU 算子或优化实现。
- 量化校准数据要贴近真实场景:用白天室内图去校准夜间监控模型,精度必掉。
- 内存带宽共抢:显示、编码、NPU 都在抢 DDR 带宽,高负载场景要统一做带宽预算。
五、典型场景算力规划
| 场景 | 建议配置 |
|---|---|
| 单路 4K 智能分析 | YOLOv8s @640,NPU 单核即可,余量充足 |
| 8 路 1080P 检测 | YOLOv8n/s × 8,三核分摊,注意解码与内存带宽 |
| 16 路以上 | 建议多颗 RK3588 或专用 AI 加速卡,单颗会到瓶颈 |
| 端侧问答/OCR 助手 | 1B 左右 INT4 模型 + 检索,接受秒级响应 |
六、虹音科技能为你做什么
我们提供 RK3588 AI 方案的算力评估、模型转换与量化调优、多路视频分析架构设计,以及软硬件一体的整机方案。如果你不确定某个模型能否在你的路数要求下跑起来,把模型和路数告诉我们,我们可以先给出算力评估结论,再决定方案。