一个工具,而非一个平台
你说话;Punchbox 转写;你校对;它可以把文本朗读出来并生成带字幕的竖屏视频。客户自行发布——不托管、不推荐任何内容,这正是让一款单人产品在法律与伦理上保持洁净的原因。
每一个引擎都在 Wolf 自己的服务器上本地且冻结运行:faster-whisper 用于转写,Piper 用于语音,ffmpeg 用于视频。没有第三方可供调用——因此也没有任何对象可供泄露。
Punchbox — 一个由 Wolf Agency 设计并运营的口述、转写与竖屏视频工作室。
这是一次工程演示,而非销售推介。Punchbox 是 Wolf 构建并运营的一款真实产品:你说话,它书写,你校对,它可以把文本朗读出来并生成带字幕的竖屏视频。它已在 punchbox.fr 上部署并运行。
诚实为先:Punchbox 处于预生产阶段。免费试用可用,但付费订阅尚未开放——因此没有客户、没有营收,也没有可供陈述的客户评价。本页面上的一切都有真实的痕迹作为支撑:一份任务报告、一次提交,或一次测量。
Punchbox 运行在自己的域名上,由一个带 TLS 的 nginx 边缘节点从加密卷提供服务。免费试用——30 分钟音频,无需银行卡——今天即可使用;付费结账尚未开放。
punchbox.frPunchbox 是一个只做一件事的工具:把你所说的话变成文本,再把文本变成一段可供发布的竖屏视频。它作为一款可安装的应用在浏览器中运行,不涉及任何第三方 API。
你说话;Punchbox 转写;你校对;它可以把文本朗读出来并生成带字幕的竖屏视频。客户自行发布——不托管、不推荐任何内容,这正是让一款单人产品在法律与伦理上保持洁净的原因。
每一个引擎都在 Wolf 自己的服务器上本地且冻结运行:faster-whisper 用于转写,Piper 用于语音,ffmpeg 用于视频。没有第三方可供调用——因此也没有任何对象可供泄露。
对着浏览器说话;faster-whisper(large-v3-turbo)跨 27 种语言进行转写,并自动检测语言。
转写稿会落入一个编辑机架——在它成为视频之前,对其进行修正、翻译与准备。
文本变成合成语音:跨 8 种欧洲语言的 13 种嗓音,每一份嗓音许可都可追溯至其来源。
已安装九对翻译语言对,每一对都带有经验证的许可,因此一份转写稿可以被渲染为另一种语言。
一段带字幕的 9:16、16:9 或 1:1 视频,由你自己的音频或合成语音生成——无需 GPU。
可作为应用安装于 Windows、Linux 与 Android;源音频在一小时内自动删除;不出售、不共享任何内容。
为运行中产品的截图预留的位置。真实截图可直接放入,无需改动布局。
录制控制台——走带、电平表与实时文本。
录制按钮与 VU 风格的电平计量。
转写稿,源文与译文并排显示。
竖屏视频生成器及其设置。
带完整走带控制的紧凑浮动面板。
Punchbox 章程与法律页面。
一份关于 Wolf 在 Punchbox 上实际产出内容的非详尽清单——每一项都有一份报告、一次提交或一次测量作为支撑。
一套封闭的设计系统,体现于三份正式章程——图形、界面与密度——一种黄铜配胶木的收音机控制台调性,一份单一样式表,以及零第三方资源。
每一个代码库与交付物都用 OpenTimestamps(SHA-256 → Bitcoin)锚定:哈希是公开的,文档保持私密,任何人都可以验证它。
一个 20 种语言的界面,具备完整的字典对等——各处的键都相同,无一缺失——包括通过 CSS 逻辑属性实现从右到左的阿拉伯语与希伯来语。
faster-whisper large-v3-turbo 覆盖 27 种语言并自动检测;在 CPU 上测得约为实时的 4×,每个任务占用 1.66 GB 内存。
跨 8 种欧洲语言的 13 种 Piper 嗓音;每一份嗓音都可追溯至其语料库与许可(CC BY / CC BY-SA),并在产品内附带强制性的署名。
已安装九对翻译语言对,每一份许可都经过验证,因此一份转写稿可以从一种语言跨越到另一种语言。
一个提词器,可渲染 9:16、16:9 与 1:1 视频;一段一分钟的竖屏片段约耗费 7 秒的算力——经测量——且无需 GPU。
生成一条 .srt 字幕轨并将其与语音对齐。
客户数据置于一个 LUKS2 卷(AES-XTS,512-bit)之上,该卷在启动时自动挂载——通过前后逐字节一致的账户数据库加以证明。
源音频由一个 systemd 定时器在一小时内自动删除;IP 地址从不以明文存储(加盐的 HMAC-SHA256,有界保留);客户选择一个上限为 30 天的保留窗口。
异地、加密、去重的备份(restic 至一个 1 TB 的 Storage Box);已从异地执行了一次真实恢复并加以验证——检查了转储完整性,回读了 37 张表。
WCAG 2.1 对比度由脚本逐对计算:正文文本为 16.26:1(AAA);将强调色用作文本被标记为 2.07:1,低于 AA,随后予以修正,使两种主题下低于阈值的配对数量均为零。
各部件如何契合:一个 nginx 边缘节点位于一款可安装应用之前,本地语音引擎,一个加密数据卷,以及一条能自证的交付链。
一个 nginx 边缘节点终结 TLS(Let’s Encrypt)并提供 punchbox.fr 的服务。
一个可安装的渐进式 Web 应用——HTML/CSS/JS,无框架、无构建——带有版本化、破缓存的资源。
一个 FastAPI 服务,配有严格的单工作者队列、密钥鉴权、配额与 GDPR 清除——经测量,并行工作者并未带来任何提升。
faster-whisper 与 Piper 在 Wolf 的服务器上本地且冻结运行;从不调用任何第三方 API。
客户数据存放于一个自动挂载的 LUKS2 卷上,由一个 systemd 定时器在一小时内清除源音频。
一个部署脚本,证明容器确实已重启——120 s 内的新鲜度、镜像 ID 匹配——否则拒绝宣称成功。它曾诚实地报告某次部署为「未获证明」并随即停止。
每夜异地加密备份(restic,已测试恢复),外加对每一个代码库与交付物的 OpenTimestamps 锚定。
Wolf 测量而非声称的两件事:引擎运行有多快,以及界面在 WCAG 上的评分如何。这些数字来自已执行的基准测试与一个逐对进行的对比度脚本。
基准测试在生产 CPU(4 核)上运行,三次一致的测试——产品中任何地方都没有 GPU。
由于模型在本地运行且从不改变,用你的声音进行训练是不可能的,而不仅仅是被禁止的。没有第三方可供调用,因此也没有任何对象可供泄露。
在实际使用的颜色配对上由脚本计算对比度——好的与坏的一并报告。
本页面上的每一项主张都与一份痕迹相绑定。工程以受追踪的任务形式进行,每一项都以一份带有已执行证据(而非代码阅读)的报告收尾;基准测试运行了三次;界面审计随附其脚本与其公式。