你好!
目前社区确实还没有公开的 SmolVLA 完整示例,官方已确认「在陆续释放,暂时没有具体排期」。
当前状态
| 模型 | 平台 | 示例状态 |
|---|---|---|
| pi0/pi0.5 | S600 | |
| SmolVLA | S600 | 宣传支持,示例未公开 |
| SmolVLM | S100/X5 |
可行方案
方案 1:先跑通 pi0 示例(推荐)
pi0 和 SmolVLA 都是 VLA 架构,部署流程高度相似:
完整文档:视觉语言动作模型(VLA)
快速开始:
# S600 端侧
cd D-Robotics_LLM_S600_1.0.2_SDK/oellm_runtime/model
mkdir -p Pi0 && cd Pi0
# 下载 pi0 模型
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_vision_224x224_w8_nash-p_corenum_1.hbm
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_language_w8_nash-p_corenum_4.hbm
wget https://d-robotics-aitoolchain.oss-cn-beijing.aliyuncs.com/llm_s600/1.0.0/models/Pi0/w8/Pi0_hammer-beat-block_action_w8_nash-p_corenum_4.hbm
# 运行示例
cd ../examples/pi0_demo/
bash run_pi0.sh
方案 2:参考 SmolVLM 转换流程
如果一定要用 SmolVLA,可以参考 SmolVLM 的量化转换方法:
参考帖子:
量化工具:SmolVLM_PTQ
方案 3:自行转换 SmolVLA
如果你有具体的 SmolVLA 模型来源,需要确认:
- 模型来源:HuggingFace/GitHub 链接
- 架构信息:
- Vision Encoder 类型(SigLip/ViT?)
- LLM 类型(PaliGemma/其他?)
- Action Head 输出维度
- 输入输出:图像尺寸、动作空间定义
然后可以参照 pi0 的流程进行:
- 模型拆分(vision/language/action)
- 量化编译(HB_TOOLCHAIN)
- 运行时配置(BPU 核分配)
建议
- 短期:先跑通 pi0 示例,理解 VLA 在 S600 上的部署流程
- 中期:关注 rdk_model_zoo_s 仓库更新
- 长期:如果项目紧急,建议通过官方技术支持渠道获取排期信息
需要我帮你详细分析 pi0 的部署流程,或者帮你查找 SmolVLA 的开源实现吗?