RK3588 NPU 实战:6TOPS 算力能跑什么模型?部署与性能优化指南

发布日期:2026-09-22 · 虹音科技 / Hongyin Tech undefined

RK3588 的 NPU 标称 6TOPS(INT8),是它区别于普通应用处理器最重要的一项能力。但「6TOPS 能跑什么」这个问题,答案取决于模型、精度和路数三者的组合。本文结合实战经验给出可落地的判断标准。

一、NPU 基础规格

项目规格
算力6 TOPS @ INT8(3 核 NPU,可独立调度)
支持精度INT4 / INT8 / INT16 / FP16
算子支持卷积、深度卷积、池化、全连接、常见激活与后处理
工具链RKNN-Toolkit2(PC 端转换)+ RKNPU2 SDK(板端推理)

注意「3 核」这个特性:三核可以并行跑不同模型或分摊同一模型,合理调度能显著提升多任务吞吐。

二、6TOPS 到底能跑多少

先给结论性的经验值(1080P 输入、INT8 量化、单核利用率约 70% 估算):

模型类型典型帧率说明
YOLOv5s / YOLOv8s约 30~60 FPS最常用组合,多路视频分析主力
YOLOv8m约 15~25 FPS精度更高,适合单路高精度场景
轻量分类(MobileNet 级)数百 FPS可多路并行
人脸检测+识别约 20~40 FPS搭配检测模型串行
姿态估计(轻量)约 20~30 FPS行为分析类项目
小参数量大模型(如 0.5B~1.5B INT4)每秒数 token ~ 十几 token端侧问答可跑,速度有限

换句话说:做多路视频智能分析(如 8~16 路 1080P 的检测)RK3588 是够用的;跑大语言模型属于「能跑但别期望快」,适合离线或轻交互场景。

三、RKNN 部署流程

  1. 模型准备:PyTorch / ONNX 模型导出为 ONNX(注意自定义算子需替换或改写)。
  2. 模型转换:在 PC 上用 RKNN-Toolkit2 载入 ONNX,配置量化数据集(建议 100~500 张真实场景图)。
  3. 量化:优先 INT8;若精度掉得多,可对敏感层保留 FP16(混合量化)。
  4. 板端推理:用 RKNPU2(C/C++ API 或 Python)在板子上加载 .rknn 模型,配合 V4L2/RTSP 取流。
  5. 零拷贝:让摄像头数据直接进入 NPU 输入内存(DMA-BUF),避免多次内存拷贝,这是提速最明显的一步。

四、性能优化要点

五、典型场景算力规划

场景建议配置
单路 4K 智能分析YOLOv8s @640,NPU 单核即可,余量充足
8 路 1080P 检测YOLOv8n/s × 8,三核分摊,注意解码与内存带宽
16 路以上建议多颗 RK3588 或专用 AI 加速卡,单颗会到瓶颈
端侧问答/OCR 助手1B 左右 INT4 模型 + 检索,接受秒级响应

六、虹音科技能为你做什么

我们提供 RK3588 AI 方案的算力评估、模型转换与量化调优、多路视频分析架构设计,以及软硬件一体的整机方案。如果你不确定某个模型能否在你的路数要求下跑起来,把模型和路数告诉我们,我们可以先给出算力评估结论,再决定方案。

需要方案定制或选型建议?
虹音科技提供瑞芯微 / 海思全平台核心板、主板与软硬件全套方案定制,工程师 1 个工作日内响应。
免费获取方案与报价 →