你好我需要在S600部署diffusion图像恢复算法,但是不量化int8,想知道s600是否支持,性能如何,我在评估和agx比较。
S600 的 BPU 总算力官方标称 560 TOPS(4x Nash core),但单独的 FP16 算力数值官方没有公开,这点如果要和 AGX 对标,建议以实测为准。
关于不量化直接跑 float16:可以支持但不是全 FP16。S600 的 BPU 支持非 gemm 算子 FP16 运算,gemm 类算子(conv/linear/matmul 等)官方建议走 int8/int16。对 diffusion 这种量化敏感模型,官方推荐的路线是「gemm 输入 int16 + 其它算子 FP16」的混合精度配置,基本可以不做 int8 也拿到接近浮点的精度,见量化精度调优指南的 S600 混合精度章节:
算子支持列表有官方页面(含 BPU 约束条件):
性能参考可以看官方 S600 Benchmark(Rspress ),不过里面没有 diffusion 类模型,你的图像恢复算法实际帧率建议拿板子用 hb_compile 转出 hbm 后实测。
你好,有没有比较完善的案例和工作流?这里需要diffusion恢复和图像增强模型转换。
结论先说:S600 支持 FP16 推理,算子列表有官方文档;diffusion 类模型官方暂无现成的完整案例,但转换工作流是通的,需要自己按 PTQ 流程验证。
1. 算力
S600 BPU 为 4 核 Nash,官方标称最高 560 TOPS(该指标为 INT8 口径,官方文档未单独公布 FP16 TOPS 数值)。S600 相比 S100P 有更强的浮点算力,支持非 gemm 算子直接 FP16 运算;推荐部署方式是混合精度:gemm 算子(conv/linear/matmul 等)走 int8/int16,其余算子走 FP16。详见「S600 混合精度调优」章节:
2. 算子支持列表(官方有)
diffusion 恢复/增强模型常见的 UNet 结构里 GroupNorm、SiLU、attention 相关算子支持情况建议先对照上面列表逐个确认。
3. 案例与工作流
官方文档目前没有 diffusion 类(图像恢复/增强)的端到端部署案例,这点如实说。可参考的路径:
建议先拿你的模型导一份 ONNX,直接用 hb_compile 跑一遍转换,编译日志会明确报出哪些算子不支持/不支持,比逐个查表更快。转换遇到不支持的算子或精度问题,可以回来帖具体报错继续聊。