各位参加影石 BOLD MAKER 智能影像挑战赛的同学、开发者,大家好!
为了方便大家查阅和开发,我们把地瓜机器人线上宣讲、9 月 22 日 Workshop「Build with Agent:在 RDK 上快速实现你的 AI Idea」,以及相关工具、模型、开发文档和社区精选帖子集中整理在这里。欢迎收藏本帖,按自己的项目进度取用。
一、宣讲资料下载
| 资料 | 内容 | 获取方式 |
|---|---|---|
| 地瓜机器人线上宣讲 PPT | RDK 平台介绍、X5 上手思路、算法案例、项目创意与开发资源 | 下载宣讲 PPT(ZIP,8.6 MB) |
**宣讲 PPT 使用方法:**下载 ZIP 后解压,用 PowerPoint 等软件打开。为符合社区附件限制,下载版缩小了图片体积,文字和页面结构保持不变。
二、Workshop 预告|9 月 22 日 17:00–17:45
活动时间:2026 年 9 月 22 日(今天)17:00–17:45,北京时间。
Workshop 尚未开始,课件暂不提供下载,将在活动后分享。
主题:Build with Agent——在 RDK 上快速实现你的 AI Idea,从一句想法,到真正跑起来。
以 RDK X5 为起点,围绕以下内容展开:
- 认识地瓜机器人与 RDK:了解平台、应用案例,以及可以用于自己项目的能力。
- 让 AI 协助连接板卡:说明板型与接线方式,检查网络、远程登录、系统和摄像头。
- 选择开发工具:了解 RDK Studio、Claude Code、Codex、OpenCode 等入口,选择适合自己的工具。
- 接入 RDK 文档 MCP 与 Skills:让 Agent 查官方手册、发现适合任务的技能,再按说明安装和使用。
- 选择 Model Zoo 示例:先跑通现成能力,再接入自己的输入和交互逻辑。
- 看输出、做验证、继续排错:程序运行成功后,还要检查画面和结果是否符合预期。
三段视觉演示与项目延伸
| 演示 | 主要内容 | 可以继续做什么 |
|---|---|---|
| Detect:目标检测 | 摄像头目标检测,并增加画面中的人数显示 | 人物入镜事件、关键片段标记、素材索引 |
| Pose:人体姿态 | 展示人体骨架与关键点,观察抬手等动作 | 动作触发拍摄、手势交互 |
| Depth:深度估计 | 对照原图与相对深度图,观察前后景层次 | 画面层次预览、主体与背景可视化 |
对应代码入口:YOLO26 Detect / Pose 示例 · YOLO26 Depth 示例。
这些方向可以作为作品的起点,具体模型、依赖和运行方式请对照仓库说明。Depth 展示的是相对深度,不能直接当作米制距离使用;动作触发等交互也需要进一步验证。
三、开发资源,一站查找
| 资源 | 适合用来做什么 |
|---|---|
| RDK 官方资料中心 | 查板卡上手、系统、接口与开发手册 |
| RDK X5 接口说明 / 远程登录 | 确认接线与连接方式 |
| RDK Studio / 快速入门 | 获取开发工具,开始连接设备与 AI |
| RDK Model Zoo | 查找 X5 的模型与部署示例 |
| RDK Skills | 查找连接、相机、诊断、模型部署等任务的技能 |
| RDK Docs MCP | 为 Agent 接入 RDK 文档检索与 Skill 发现入口 |
| TROS Web 展示说明 | 了解如何在浏览器查看图像与算法结果 |
把这句话发给你的 AI,开始接入文档检索
根据 https://cdn.jsdelivr.net/npm/rdk-docs-mcp@latest/install.md 安装 RDK 文档检索。
按照安装说明完成配置并重载会话,确认工具可用后,再让 AI 根据板型和任务查资料、找技能。检索到 Skill 后,还需按说明安装和执行。
四、社区精选案例:看看大家用 RDK 做出了什么
下面精选了社区中带有 “分享帖”标签的项目与实践。想找作品灵感、参考实现,或者在现有开源项目上继续开发,可以从这些案例开始。
1. MicroDuck 机器鸭:把视觉接到运动控制上
全网刷屏的机器鸭,我们把它“养”上了云——还能用一块 RDK X5 遛它
平台:RDK X5 · 分享者:qiaolongli1
基于 Pollen Robotics 的开源 MicroDuck,作者将板端运动控制、BPU 视觉和云端仿真展示结合起来,分享了机器鸭行走、踢球与视觉追球等演示。这是板卡参与的仿真案例,实体机器鸭落地是后续方向。
**可以借鉴:**让“看到了什么”进一步驱动“接下来做什么”,把视觉识别结果变成一个有反馈的交互过程。
2. X5 三模式视觉:把算法做成可切换的展示应用
【开源分享】【RDK X5】三模式视觉:YOLO、双目深度、人体年龄与 SPI 全屏切换
平台:RDK X5 · 分享者:guosheng_xu
将目标检测、深度与人体相关能力集成到一套展示工程,在 SPI 触屏和电脑浏览器中切换模式。原帖提供源码、安装说明与验证记录;双目测距标定仍待验收,年龄输出属于模型估计。
**可以借鉴:**在 Workshop 的模型演示之上,继续加入模式选择、界面展示与设备启动流程,让算法成为可以操作的作品。
3. 检测 + 深度双模型:同一画面里的多种视觉能力
【开源分享】【RDK S100P】YOLO26 检测 + 单目深度 双模型 BPU 并发实时演示
平台:RDK S100P · 分享者:Marcelo
把目标检测、人物跟踪与单目深度组合到同一应用中,提供浏览器面板和 HDMI 展示,并开放项目代码。
**可以借鉴:**组合“画面里有什么”和“前后层次如何”,设计更丰富的影像分析与展示界面。X5 开发者可以结合上面的移植案例阅读,按板型选择模型与部署方式。
4. OCR 文字识别:从自己的数据到板端应用
从 PaddleOCR 到 RDK BPU:RoboGo × Model Zoo OCR 全链路快速体验(X5 / S100 / S100P / S600)
平台:X5 / S 系列分平台流程 · 分享者:电动三轮车
串联文字检测、文字识别、训练、模型转换和部署验证,提供对应镜像与实践入口。帖内 X5 使用 PP-OCRv3,S 系列使用 PP-OCRv6 Tiny。
**可以借鉴:**围绕画面中的文字,探索信息提取、文字读取和辅助提示类作品,再用自己的场景数据验证效果。
以上案例均链接到原作者的社区分享,代码、演示和更新记录请查看原帖;按自己的板型选择实现。
五、建议从一个小闭环开始
连接板卡 → 跑通一个官方示例 → 换成自己的输入 → 加入一项交互 → 验证展示效果。
例如,先实现“识别到人物并显示人数”,再扩展为“人物入镜时记录时间戳”。先让一个清晰的小任务真正跑起来,再增加功能。
遇到问题,欢迎在社区发帖交流,并附上:板卡型号、系统版本、连接方式、运行步骤、报错日志或异常画面。这样更方便一起定位问题。
赛事安排、设备领取与现场事项,以主办方及现场通知为准。
资料整理:2026 年 9 月 22 日。欢迎大家带着这些资料,把想法做成能演示的作品!