← 回到 项目

基于树莓派的 AI Camera 影像生成系统

AI Camera: A Raspberry Pi Image-to-Video Generation System

一台树莓派装进红色 3D 打印外壳:拍一张照片,或者说出一段梦,它把这些变成一条有镜头语言的短片。

看代码

角色
课程项目 · 电子科学创新实验 III
时间
2025.09 – 2026.06
机构
南方科技大学 指导 Dr. Junmin Jiang

为什么做这件事

AIGC 已经能把图片变成视频,但那都是在网页上点几下的事 —— 拍摄设备本身还是只会记录。这个项目想让相机变成创作终端:它得理解你为什么拍这张照片,把你补充的故事和情绪组织成镜头语言,再输出成片。难点不在调某一个 API,而在于把相机、麦克风、大模型、视频生成服务这些各自都会出错的东西,串成一条普通人能用完的流程。

我做了什么

  • 用 Picamera2 做实时取景与拍照,PySide6 搭出首页、拍摄、故事、提示词、视频、历史、设置七个页面的本地图形界面。
  • 设计三种创作模式:拍下现实(照片 + 故事)、恢复梦境(纯文本/语音)、黑盒终章(叙事碎片重构)。
  • 接 OpenAI Chat Completions 做「AI 导演」,把照片和用户故事转成电影化的导演方案,再由 prompt_optimizer 压缩翻译成适合 Runway 的英文短提示词。
  • 接 OpenAI Realtime WebSocket 做实时语音转写,加了音量阈值、静音自动提交、最大片段时长和录音留存,解决转写分段不稳的问题。
  • 调 Runway API 生成视频,支持 Gen-4 / Gen-4.5 / Veo / Seedance 多套模型配置;生成放进后台线程,避免几分钟的等待卡死界面。
  • 把照片、文字、语音、提示词、视频统一组织进会话目录(metadata.json + photos/story/prompts/videos/audio),每个作品都能追溯。
  • 建模并 3D 打印三件式外壳:正面开窗露出相机模组,侧边留电源和网线接口,围着排线弯折和后期维护来设计。

《电子科学创新实验 III》课程项目。下面是装好的机器和界面演示录屏。

三件式外壳装好的样子。正面开窗露出 Raspberry Pi Camera 模组,黄色排线从窗口内侧绕进主板,侧边留出电源和网线口。开窗的位置和排线的弯折半径是照着真实板子量的,不是先建模再硬塞。
三件式外壳装好的样子。正面开窗露出 Raspberry Pi Camera 模组,黄色排线从窗口内侧绕进主板,侧边留出电源和网线口。开窗的位置和排线的弯折半径是照着真实板子量的,不是先建模再硬塞。
另一个角度。
另一个角度。
界面演示

结果

  • 三种创作模式全部端到端跑通,测试作品保存在 sessions 目录。
  • 典型测试:3 张照片 + 故事生成 3 个视频版本;语音梦境生成暴雨邮轮短片;密室叙事生成科幻终章(Gen-4.5、5–8 秒、1280×720)。
  • 外壳完成打印装配,项目从「能运行的程序」变成「能展示的装置」。

用到的技术

  • Raspberry Pi
  • Picamera2
  • PySide6 / Qt
  • OpenAI API
  • Runway API
  • WebSocket 实时语音
  • 多线程
  • 3D 建模与打印