¿Debo autoalojar Whisper o usar una API?
Respuesta corta
Por debajo de ~500 horas de audio/mes, una API gestionada casi siempre gana; por encima, autoalojar puede salir más barato, pero solo con experiencia GPU y presupuesto DevOps.
Whisper es de código abierto – puedes ejecutarlo gratis en tu propio hardware. Suena tentador, pero hay matices. Un cálculo honesto.
Qué necesitas para alojar Whisper - GPU: al menos 10 GB de VRAM para Whisper-Large. Una RTX 4090 (~2.000 $) o una A100 en la nube (~2 $/h en spot). - Docker, NVIDIA Container Toolkit, posiblemente Kubernetes. - Cola de jobs (Redis + BullMQ, Sidekiq, Celery). - Almacenamiento de archivos para el audio (compatible con S3, o local con copia de seguridad). - Monitorización (Prometheus, Grafana, Sentry). - Lógica de escalado para los picos de tráfico. - Posibles complementos: WhisperX para la diarización, tu propio wrapper de API alrededor de Whisper.
Lo que Whisper no hace de fábrica - Diarización de hablantes (necesita WhisperX o pyannote.audio). - Streaming en tiempo real (necesita Faster-Whisper + código a medida). - Marcas de tiempo por palabra imprecisas en algunas variantes. - Webhooks, límites de tasa, multi-tenant – los construyes tú. - Cumplimiento del RGPD – tú eres el responsable del tratamiento, ningún proveedor comparte la responsabilidad.
Coste con 500 h/mes - DeepScript Standard: 500 h × 0,18 € = 90 €/mes. - Autoalojado en servidor GPU de Hetzner (GEX44 con RTX 6000 ADA, ~700 €/mes): 700 € + recargo de electricidad, más el tiempo de DevOps. - Autoalojado en AWS (g5.xlarge, ~1,00 $/h en spot, 24/7): ~720 $/mes más almacenamiento y egress de red.
Cuándo tiene sentido autoalojar - Transcribes > 2.000 h/mes y la carga se mantiene estable durante meses. - Ya tienes infraestructura GPU en casa (investigación de ML, flota de servidores de juego sobrante). - Necesitas una soberanía de datos extrema (p. ej. entornos aislados para la administración pública). - Haces fine-tuning de Whisper en tu dominio – las API rara vez lo permiten.
Cuándo gana una API - < 500 h/mes: la API es más barata, más simple, más rápida de desplegar. - Necesitas diarización, Custom Vocabulary, webhooks sin construirlos. - Necesitas un SLA y soporte 24/7. - Necesitas un cumplimiento del RGPD por escrito (DPA, lista de subencargados). - Quieres centrarte en tu producto, no en los drivers de la GPU.
Variante híbrida Algunos equipos usan DeepScript para los datos de clientes relevantes para el RGPD y Whisper autoalojado para cargas internas de bajo riesgo. Optimización de costes limpia – si la capacidad de DevOps está ahí.
Regla general Si aún no tienes un equipo con experiencia en GPU: API. Si lo tienes y el volumen encaja: autoalojar. Pero calcula con honestidad – la mayoría subestima los costes operativos recurrentes y sobrestima el ahorro.
Preguntas relacionadas
¿Te queda alguna pregunta?
Tres transcripciones gratis para probar. O escríbenos un correo – respondemos en menos de 24 horas, también a preguntas de cumplimiento.