[SmolVLA][S600][S600上转换SmolVLA模型并运行示例求助]

你好!

目前社区确实还没有公开的 SmolVLA 完整示例,官方已确认「在陆续释放,暂时没有具体排期」。

当前状态

模型 平台 示例状态
pi0/pi0.5 S600 :white_check_mark: 已释放,有完整文档
SmolVLA S600 宣传支持,示例未公开
SmolVLM S100/X5 :white_check_mark: 有部署案例(但这是 VLM,不是 VLA)

可行方案

方案 1:先跑通 pi0 示例(推荐)

pi0 和 SmolVLA 都是 VLA 架构,部署流程高度相似:

完整文档视觉语言动作模型(VLA)

快速开始

# S600 端侧
cd D-Robotics_LLM_S600_1.0.2_SDK/oellm_runtime/model
mkdir -p Pi0 && cd Pi0

# 下载 pi0 模型
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_vision_224x224_w8_nash-p_corenum_1.hbm
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_language_w8_nash-p_corenum_4.hbm
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_action_w8_nash-p_corenum_4.hbm

# 运行示例
cd ../examples/pi0_demo/
bash run_pi0.sh

方案 2:参考 SmolVLM 转换流程

如果一定要用 SmolVLA,可以参考 SmolVLM 的量化转换方法:

参考帖子

量化工具SmolVLM_PTQ

方案 3:自行转换 SmolVLA

如果你有具体的 SmolVLA 模型来源,需要确认:

  1. 模型来源:HuggingFace/GitHub 链接
  2. 架构信息
    • Vision Encoder 类型(SigLip/ViT?)
    • LLM 类型(PaliGemma/其他?)
    • Action Head 输出维度
  3. 输入输出:图像尺寸、动作空间定义

然后可以参照 pi0 的流程进行:

  • 模型拆分(vision/language/action)
  • 量化编译(HB_TOOLCHAIN)
  • 运行时配置(BPU 核分配)

建议

  1. 短期:先跑通 pi0 示例,理解 VLA 在 S600 上的部署流程
  2. 中期:关注 rdk_model_zoo_s 仓库更新
  3. 长期:如果项目紧急,建议通过官方技术支持渠道获取排期信息

需要我帮你详细分析 pi0 的部署流程,或者帮你查找 SmolVLA 的开源实现吗?