Aller au contenu principal
Étude de cas · Ce que Wolf sait faire, prouvé sur un produit réel

Punchbox — un studio voix-vers-vidéo respectueux de la vie privée

Punchbox — un studio de dictée, transcription et vidéo verticale, conçu et exploité par Wolf Agency.

Ceci est une démonstration d’ingénierie, pas un argumentaire commercial. Punchbox est un produit réel que Wolf construit et exploite : on parle, ça écrit, on relit, ça peut lire le texte à voix haute et fabriquer une vidéo verticale sous-titrée. Il est déployé et tourne sur punchbox.fr.

L’honnêteté d’abord : Punchbox est en pré-production. L’essai gratuit fonctionne, mais les abonnements payants ne sont pas encore ouverts — donc aucun client, aucun revenu et aucun témoignage à présenter. Tout sur cette page est adossé à une trace réelle : un rapport de mission, un commit, ou une mesure.

En pré-production Interface en 20 langues Contraste WCAG mesuré appel à une API tierce — les moteurs sont locaux et figés
Le produit

Un studio voix-vers-vidéo de poche

Punchbox est un outil à une seule tâche : transformer ce que vous dites en texte, et le texte en vidéo verticale prête à poster. Il tourne dans le navigateur comme une application installable, sans aucune API tierce.

Un outil, pas une plateforme

Vous parlez ; Punchbox transcrit ; vous relisez ; il peut relire le texte à voix haute et fabriquer une vidéo verticale sous-titrée. Le client la poste lui-même — rien n’est hébergé ni recommandé, ce qui est exactement ce qui garde un produit d’une seule personne propre, juridiquement et éthiquement.

Chaque moteur tourne en local et figé sur le serveur de Wolf : faster-whisper pour la transcription, Piper pour la voix, ffmpeg pour la vidéo. Il n’y a aucune API tierce à appeler — donc personne à qui fuiter.

Dicter → transcrire

On parle dans le navigateur ; faster-whisper (large-v3-turbo) transcrit dans 27 langues, avec détection automatique de la langue.

Relire & corriger

La transcription arrive dans un rack d’édition — on la corrige, on la traduit, on la prépare avant qu’elle devienne une vidéo.

Synthèse vocale

Le texte devient une voix de synthèse : 13 voix dans 8 langues européennes, chaque licence de voix remontée jusqu’à sa source.

Traduction

Neuf paires de traduction installées, chacune à licence vérifiée, pour rendre une transcription dans une autre langue.

Vidéo verticale

Une vidéo sous-titrée 9:16, 16:9 ou 1:1 est fabriquée depuis votre propre audio ou une voix de synthèse — sans GPU.

À vous, et privé

Installable comme application sur Windows, Linux et Android ; l’audio source est effacé sous une heure ; rien n’est vendu ni partagé.

Écrans

À quoi ça ressemble

Emplacements réservés pour les captures du produit en marche. Les vraies captures se déposent sans toucher à la mise en page.

  • La console de dictée Capture — emplacement réservé

    La console d’enregistrement — transport, VU-mètre et texte en direct.

  • Transport & VU-mètre Capture — emplacement réservé

    Le bouton d’enregistrement et la mesure de niveau.

  • Moniteur de texte Capture — emplacement réservé

    La transcription, source et traduction côte à côte.

  • Fabrique vidéo Capture — emplacement réservé

    Le fabricant de vidéo verticale et ses réglages.

  • Mode flottant Capture — emplacement réservé

    Le panneau flottant compact, transport complet.

  • Charte & mentions Capture — emplacement réservé

    La charte Punchbox et les pages légales.

Ce que Wolf a fait

Conçu, mesuré, livré

Une liste non exhaustive de ce que Wolf a réellement produit sur Punchbox — chaque point adossé à un rapport, un commit ou une mesure.

Design system & chartes

Un design system fermé en trois chartes formelles — graphique, interface et densité — un registre « régie radio », laiton sur bakélite, une seule feuille de style, et zéro ressource tierce.

Horodatage d’antériorité

Chaque dépôt et livrable est ancré par OpenTimestamps (SHA-256 → Bitcoin) : l’empreinte est publique, le document reste privé, et n’importe qui peut vérifier.

Interface en 20 langues

Une interface en 20 langues à parité de dictionnaire complète — les mêmes clés partout, aucune manquante — dont l’arabe et l’hébreu en droite-à-gauche via les propriétés logiques CSS.

Transcription multilingue

faster-whisper large-v3-turbo couvrant 27 langues avec détection automatique ; mesuré à environ 4× le temps réel sur CPU, 1,66 Go de RAM par tâche.

Synthèse vocale

13 voix Piper dans 8 langues européennes ; chaque voix remontée jusqu’à son corpus et sa licence (CC BY / CC BY-SA), avec l’attribution obligatoire portée dans le produit.

Traduction

Neuf paires de traduction installées, chaque licence vérifiée, pour faire passer une transcription d’une langue à une autre.

Moteur de vidéo verticale

Un prompteur qui rend de la vidéo 9:16, 16:9 et 1:1 ; une minute de vidéo verticale coûte environ 7 secondes de calcul — mesuré — sans GPU.

Sous-titres calés

Une piste de sous-titres .srt est générée et calée sur la voix.

Chiffrement au repos

Les données client reposent sur un volume LUKS2 (AES-XTS, 512 bits) monté automatiquement au démarrage — prouvé, base des comptes octet-pour-octet identique avant et après.

RGPD dès la conception

L’audio source est effacé sous une heure par un timer systemd ; les adresses IP ne sont jamais stockées en clair (HMAC-SHA256 salé, rétention bornée) ; le client choisit une durée de rétention plafonnée à 30 jours.

Sauvegardes prouvées restaurables

Sauvegardes hors-site, chiffrées, dédupliquées (restic vers un Storage Box de 1 To) ; une vraie restauration a été exécutée depuis le hors-site et vérifiée — intégrité du dump contrôlée, 37 tables relues.

Accessibilité mesurée

Contraste WCAG 2.1 calculé paire par paire par script : texte principal à 16,26:1 (AAA) ; des emplois d’accent-en-texte signalés à 2,07:1 sous le seuil AA, puis corrigés à zéro paire sous seuil dans les deux thèmes.

Sous le capot

La chaîne technique

Comment les pièces s’emboîtent : un edge nginx devant une application installable, des moteurs vocaux locaux, un volume de données chiffré, et une chaîne de livraison qui se prouve elle-même.

Edge & TLS

Un edge nginx termine le TLS (Let’s Encrypt) et sert punchbox.fr.

L’application (PWA)

Une application web progressive installable — HTML/CSS/JS, sans framework, sans build — aux ressources versionnées et anti-cache.

API de transcription

Un service FastAPI à file stricte, un seul travailleur, auth par clé, quotas et purge RGPD — le parallélisme a été mesuré comme n’apportant rien.

Moteurs vocaux locaux

faster-whisper et Piper tournent en local et figés sur le serveur de Wolf ; aucune API tierce n’est jamais appelée.

Volume de données chiffré

Les données client vivent sur un volume LUKS2 monté automatiquement, avec un timer systemd qui purge l’audio source sous une heure.

Un déploiement qui se prouve

Un script de déploiement qui prouve que le conteneur a réellement redémarré — fraîcheur sous 120 s, correspondance de l’empreinte d’image — et refuse de conclure à la réussite sinon. Il a déjà honnêtement rapporté un déploiement NON PROUVÉ et s’est arrêté.

Sauvegardes & antériorité

Sauvegardes chiffrées hors-site chaque nuit (restic, restauration testée), plus l’ancrage OpenTimestamps de chaque dépôt et livrable.

Une chaîne scriptée honnêtement — la preuve plutôt que l’affirmation, pas un CI lourd sur étagère.
La preuve

Mesuré, pas affirmé

Deux choses que Wolf a mesurées au lieu de les affirmer : la vitesse des moteurs, et le score de l’interface face à WCAG. Les chiffres viennent de bancs d’essai exécutés et d’un script de contraste paire par paire.

Mesuré sur le serveur

Ce que coûtent les moteurs

Bancs d’essai sur le CPU de production (4 cœurs), trois passages concordants — aucun GPU nulle part dans le produit.

Vitesse de transcription
≈ 4× le temps réel
RAM par tâche
1,66 Go
Vidéo verticale d’1 min
≈ 7 s de calcul
Le cœur 0 appel à une API tierce — les moteurs sont locaux et figés

Parce que les modèles tournent en local et ne changent jamais, s’entraîner sur votre voix est impossible, pas seulement interdit. Il n’y a aucune API tierce à appeler, donc personne à qui fuiter.

WCAG 2.1, paire par paire

Le contraste, mesuré

Ratios de contraste calculés par script sur les paires de couleurs réellement employées — le bon comme le mauvais, rapportés pareil.

Texte principal (clair)
16,26:1
Texte principal (sombre)
15,45:1
Accent-en-texte signalé
2,07:1
Cible WCAG AA
4,5:1
L’audit a trouvé de vrais échecs et les a nommés ; ils ont été corrigés à zéro paire sous seuil dans la console, dans les deux thèmes.
La preuve

Comment c’est prouvé

Chaque affirmation de cette page est reliée à une trace. L’ingénierie a été menée en missions tracées, chacune terminée par un rapport à preuve exécutée plutôt qu’une lecture de code ; les bancs d’essai ont été passés trois fois ; l’audit d’interface livre son script et sa formule.

  • Les chiffres sont mesurés sur le vrai serveur, pas estimés.
  • Les forces nées d’un écart sont montrées en écart → correctif, les deux côtés prouvés.
  • Les limites sont dites : pas de navigateur sur la machine de build, donc rendu visuel et lecteur d’écran restent à vérifier.
  • L’antériorité est ancrée publiquement (OpenTimestamps) tandis que les documents restent privés.
Ce que cela prouve

Une méthode de travail, montrée sur un produit réel

Punchbox, c’est la façon de travailler de Wolf rendue visible : conception, accessibilité mesurée, déploiement industrialisé avec preuve de redémarrage, sauvegardes prouvées, RGPD et horodatage d’antériorité — sur un produit qui tourne vraiment.

La même méthode s’applique à d’autres projets aux mêmes conditions. Punchbox est en pré-production ; il n’y a aucun chiffre de clients ni de revenus à montrer, et nous n’en inventerons aucun.

Chaque chiffre de cette page est une mesure réelle à source vérifiable.