RDK X5本地部署大模型gemma4

结论

理论上可行,但需要验证和适配。社区已有在 RDK X5 上成功部署 VLM 的案例(InternVL2.5-1B + Qwen2.5-0.5B),但 Qwen2-VL-2B 参数量更大,需要评估内存和性能。


社区已有成功案例参考

目前 X5 上已验证的 VLM 部署方案:

模型 语言部分 视觉部分 状态
InternVL2.5-1B Qwen2.5-0.5B-Q4_0.gguf vit_model_int16_v2.bin :white_check_mark: 已验证
SmolVLM-256M 内置 SigLip_int16.bin :white_check_mark: 已验证
Qwen2-VL-2B 待验证 待验证 :warning: 需测试

参考帖子:


Qwen2-VL-2B 部署挑战

1. 内存限制

  • X5 需配置 ION memory 为 2.5GB(使用 srpi-config 工具)
  • 2B 模型的 KV Cache + 权重可能接近内存上限
  • 建议使用 Q4_0 或 Q8_0 量化版本 的 GGUF 格式

2. 性能预期

根据社区反馈:

  • InternVL2.5-1B(0.5B 语言模型):每字生成约 5-6 秒
  • 整体推理速度:< 1 FPS
  • Qwen2-VL-2B 参数量更大,速度可能更慢

3. 模型格式要求

需要两种权重文件:

├── qwen2_vl_vit_int16.bin    # 视觉编码器(需 BPU 适配版本)
└── qwen2_vl_2b_q4_0.gguf     # 语言模型(GGUF 格式)

部署步骤参考(基于 InternVL 方案)

Step 1: 准备 llama.cpp 环境

# 克隆适配 BPU 的 llama.cpp 版本
git clone https://github.com/zixi01chen/llama.cpp_internvl2_bpu
cd llama.cpp_internvl2_bpu
git clone https://github.com/ggerganov/llama.cpp -b b4749

# 替换示例文件
cp ../src/x5/* ./examples/llava/

Step 2: 配置 X5 内存

# 设置 ION memory 为 2.5GB
srpi-config
# 参考:Performance Options → ION Memory

Step 3: 编译

cd llama.cpp
cmake -B build
cmake --build build --config Release

Step 4: 准备模型权重

  • 视觉部分:需要联系地瓜 FAE 获取 Qwen2-VL 的 BPU 适配权重(.bin 格式)
  • 语言部分:从 HuggingFace 下载 GGUF 量化版本
    # 示例(需确认是否有 Qwen2-VL 的 GGUF)
    huggingface-cli download ggml-org/Qwen2-VL-2B-Instruct-GGUF
    

Step 5: 运行测试

./build/bin/llama-intern2vl-bpu-cli \
  -m ./qwen2_vl_2b_q4_0.gguf \
  --mmproj ./qwen2_vl_vit_int16.bin \
  --image ./test_image.jpg \
  -p "描述一下这张图片." \
  --temp 0.5 \
  --threads 8

关键问题确认

1. Qwen2-VL 是否有 BPU 适配的视觉权重?

  • InternVL 和 SmolVLM 都有地瓜官方提供的 .bin 权重
  • Qwen2-VL 需要确认是否有适配版本
  • 建议:联系地瓜 FAE 或查看 Model Zoo

2. 2B 参数是否在 X5 承受范围内?

  • 已验证的 InternVL2.5-1B 语言部分仅 0.5B
  • 2B 是 4 倍参数量,内存和算力压力更大
  • 建议:先尝试 Qwen2-VL-0.5BQwen2.5-0.5B 验证流程

3. 比赛实时性要求?

  • 如果比赛需要实时交互(>5 FPS),VLM 方案可能不满足
  • 如果只是离线/单次调用,可以接受
  • 备选:考虑方案二(YOLO + 模板生成)更稳妥

推荐行动路径

1. 确认比赛对"图生文"的实时性要求
   ↓
2. 联系地瓜 FAE 确认 Qwen2-VL-2B 是否有 BPU 适配权重
   ↓
3. 如果有 → 按上述步骤部署测试
   ↓
4. 如果没有/性能不足 → 降级到 Qwen2-VL-0.5B 或 InternVL2.5-1B
   ↓
5. 仍不满足 → 采用 YOLO + 场景分类 + 模板生成方案

相关资源

需要我帮你查找 Qwen2-VL 的 GGUF 权重下载链接,或者联系地瓜 FAE 确认 BPU 适配情况吗?