Dois-je auto-héberger Whisper ou utiliser une API ?
Réponse courte
Sous ~500 heures d'audio/mois, une API managée l'emporte presque toujours ; au-delà, l'auto-hébergement peut être moins cher, mais seulement avec une expérience GPU et un budget DevOps.
Whisper est open source – vous pouvez l'exécuter gratuitement sur votre propre matériel. Cela semble tentant, mais il y a des nuances. Un calcul honnête.
Ce qu'il faut pour héberger Whisper - GPU : au moins 10 Go de VRAM pour Whisper-Large. Une RTX 4090 (~2 000 $) ou une A100 dans le cloud (~2 $/h en spot). - Docker, NVIDIA Container Toolkit, éventuellement Kubernetes. - File de jobs (Redis + BullMQ, Sidekiq, Celery). - Stockage de fichiers pour l'audio (compatible S3, ou local avec sauvegarde). - Supervision (Prometheus, Grafana, Sentry). - Logique de mise à l'échelle pour les pics de charge. - Modules éventuels : WhisperX pour la diarisation, votre propre wrapper API autour de Whisper.
Ce que Whisper ne fait pas d'emblée - Diarisation des locuteurs (nécessite WhisperX ou pyannote.audio). - Streaming en temps réel (nécessite Faster-Whisper + code sur mesure). - Horodatages par mot imprécis dans certaines variantes. - Webhooks, limites de débit, multi-tenant – à construire vous-même. - Conformité RGPD – vous êtes le responsable du traitement, aucun fournisseur ne partage la responsabilité.
Coût à 500 h/mois - DeepScript Standard : 500 h × 0,18 € = 90 €/mois. - Auto-hébergé sur serveur GPU Hetzner (GEX44 avec RTX 6000 ADA, ~700 €/mois) : 700 € + surcoût d'électricité, plus le temps DevOps. - Auto-hébergé sur AWS (g5.xlarge, ~1,00 $/h en spot, 24/7) : ~720 $/mois plus le stockage et l'egress réseau.
Quand l'auto-hébergement a du sens - Vous transcrivez > 2 000 h/mois et la charge reste stable sur plusieurs mois. - Vous avez déjà une infrastructure GPU en interne (recherche ML, parc de serveurs de jeu restant). - Vous avez besoin d'une souveraineté des données extrême (par ex. environnements isolés pour l'administration). - Vous fine-tunez Whisper sur votre domaine – les API le permettent rarement.
Quand une API l'emporte - < 500 h/mois : l'API est moins chère, plus simple, plus rapide à déployer. - Vous avez besoin de la diarisation, de la Custom Vocabulary, de webhooks sans les construire. - Vous avez besoin d'un SLA et d'un support 24/7. - Vous avez besoin d'une conformité RGPD écrite (DPA, liste de sous-traitants). - Vous voulez vous concentrer sur votre produit, pas sur les pilotes GPU.
Variante hybride Certaines équipes utilisent DeepScript pour les données clients soumises au RGPD et Whisper auto-hébergé pour les charges internes à faible enjeu. Optimisation des coûts propre – si la capacité DevOps est là.
Règle générale Si vous n'avez pas déjà une équipe avec une expérience GPU : API. Si oui et que le volume correspond : auto-hébergement. Mais chiffrez honnêtement – la plupart sous-estiment les coûts d'exploitation courants et surestiment les économies.
Questions associées
Une question reste sans réponse ?
Trois transcriptions gratuites pour essayer. Ou écrivez-nous un e-mail – nous répondons sous 24 heures, questions de conformité comprises.