基于树莓派的 AI Camera 影像生成系统
AI Camera: A Raspberry Pi Image-to-Video Generation System
一台树莓派装进红色 3D 打印外壳:拍一张照片,或者说出一段梦,它把这些变成一条有镜头语言的短片。
- 角色
- 课程项目 · 电子科学创新实验 III
- 时间
- 2025.09 – 2026.06
- 机构
- 南方科技大学 指导 Dr. Junmin Jiang
为什么做这件事
AIGC 已经能把图片变成视频,但那都是在网页上点几下的事 —— 拍摄设备本身还是只会记录。这个项目想让相机变成创作终端:它得理解你为什么拍这张照片,把你补充的故事和情绪组织成镜头语言,再输出成片。难点不在调某一个 API,而在于把相机、麦克风、大模型、视频生成服务这些各自都会出错的东西,串成一条普通人能用完的流程。
我做了什么
- 用 Picamera2 做实时取景与拍照,PySide6 搭出首页、拍摄、故事、提示词、视频、历史、设置七个页面的本地图形界面。
- 设计三种创作模式:拍下现实(照片 + 故事)、恢复梦境(纯文本/语音)、黑盒终章(叙事碎片重构)。
- 接 OpenAI Chat Completions 做「AI 导演」,把照片和用户故事转成电影化的导演方案,再由 prompt_optimizer 压缩翻译成适合 Runway 的英文短提示词。
- 接 OpenAI Realtime WebSocket 做实时语音转写,加了音量阈值、静音自动提交、最大片段时长和录音留存,解决转写分段不稳的问题。
- 调 Runway API 生成视频,支持 Gen-4 / Gen-4.5 / Veo / Seedance 多套模型配置;生成放进后台线程,避免几分钟的等待卡死界面。
- 把照片、文字、语音、提示词、视频统一组织进会话目录(metadata.json + photos/story/prompts/videos/audio),每个作品都能追溯。
- 建模并 3D 打印三件式外壳:正面开窗露出相机模组,侧边留电源和网线接口,围着排线弯折和后期维护来设计。
《电子科学创新实验 III》课程项目。下面是装好的机器和界面演示录屏。


结果
- 三种创作模式全部端到端跑通,测试作品保存在 sessions 目录。
- 典型测试:3 张照片 + 故事生成 3 个视频版本;语音梦境生成暴雨邮轮短片;密室叙事生成科幻终章(Gen-4.5、5–8 秒、1280×720)。
- 外壳完成打印装配,项目从「能运行的程序」变成「能展示的装置」。
用到的技术
- Raspberry Pi
- Picamera2
- PySide6 / Qt
- OpenAI API
- Runway API
- WebSocket 实时语音
- 多线程
- 3D 建模与打印