Czy hostować Whisper samodzielnie, czy użyć API?
Krótka odpowiedź
Poniżej ~500 godzin audio/miesiąc zarządzane API niemal zawsze wygrywa; powyżej self-hosting może być tańszy, ale tylko z doświadczeniem w GPU i budżetem DevOps.
Whisper jest open source – możesz uruchomić go za darmo na własnym sprzęcie. Brzmi kusząco, ale są niuanse. Uczciwe wyliczenie.
Czego potrzebujesz, by hostować Whisper - GPU: co najmniej 10 GB VRAM dla Whisper-Large. RTX 4090 (~2 000 $) lub A100 w chmurze (~2 $/godz. w spot). - Docker, NVIDIA Container Toolkit, ewentualnie Kubernetes. - Kolejka zadań (Redis + BullMQ, Sidekiq, Celery). - Magazyn plików na audio (kompatybilny z S3 lub lokalny z kopią zapasową). - Monitoring (Prometheus, Grafana, Sentry). - Logika skalowania na skoki obciążenia. - Możliwe dodatki: WhisperX do diaryzacji, własny wrapper API wokół Whisper.
Czego Whisper nie robi od ręki - Diaryzacji mówców (potrzebny WhisperX lub pyannote.audio). - Streamingu w czasie rzeczywistym (potrzebny Faster-Whisper + własny kod). - Znaczniki czasu na słowo bywają niedokładne w niektórych wariantach. - Webhooki, limity zapytań, multi-tenant – budujesz sam. - Zgodności z RODO – to Ty jesteś administratorem, żaden dostawca nie współdzieli odpowiedzialności.
Koszt przy 500 godz./miesiąc - DeepScript Standard: 500 godz. × 0,18 € = 90 €/miesiąc. - Self-hosted na serwerze GPU Hetzner (GEX44 z RTX 6000 ADA, ~700 €/miesiąc): 700 € + dopłata za prąd, plus czas DevOps. - Self-hosted na AWS (g5.xlarge, ~1,00 $/godz. w spot, 24/7): ~720 $/miesiąc plus magazyn i egress sieciowy.
Kiedy self-hosting ma sens - Transkrybujesz > 2 000 godz./miesiąc, a obciążenie pozostaje stabilne przez miesiące. - Masz już infrastrukturę GPU u siebie (badania ML, pozostała flota serwerów do gier). - Potrzebujesz ekstremalnej suwerenności danych (np. środowiska air-gapped dla administracji). - Robisz fine-tuning Whisper na swojej domenie – API rzadko na to pozwala.
Kiedy wygrywa API - < 500 godz./miesiąc: API jest tańsze, prostsze, szybsze we wdrożeniu. - Potrzebujesz diaryzacji, Custom Vocabulary, webhooków bez ich budowania. - Potrzebujesz SLA i wsparcia 24/7. - Potrzebujesz pisemnej zgodności z RODO (DPA, lista podwykonawców). - Chcesz skupić się na produkcie, nie na sterownikach GPU.
Wariant hybrydowy Niektóre zespoły używają DeepScript do danych klientów istotnych dla RODO, a self-hosted Whisper do wewnętrznych, mało krytycznych obciążeń. Czysta optymalizacja kosztów – jeśli jest moc przerobowa DevOps.
Zasada ogólna Jeśli nie masz jeszcze zespołu z doświadczeniem w GPU: API. Jeśli masz i wolumen się zgadza: self-hosting. Ale licz uczciwie – większość niedoszacowuje bieżące koszty operacyjne i przeszacowuje oszczędności.
Powiązane pytania
Masz jeszcze pytanie?
Trzy transkrypcje za darmo na próbę. Albo napisz do nas e-mail – odpowiadamy w ciągu 24 godzin, również na pytania dotyczące zgodności.