KI-Server mieten: Preise für Managed GPU-Server in Deutschland
Einen Managed KI-Server von Verdacloud mieten Sie ab 790 € pro Monat (Verda GPU S) bzw. ab 2.690 € pro Monat (Verda GPU L), jeweils netto bei 12 Monaten Laufzeit. Im Preis enthalten sind dedizierte Hardware in ISO-27001-zertifizierten Rechenzentren in Deutschland und der laufende Betrieb durch unser Team; die Einrichtung kalkulieren wir nach Angebot.
KI-Server Preise: die zwei Pakete im Überblick
Wir bieten zwei klar definierte GPU-Klassen an. Beide sind dedizierte Server, die ausschließlich für Sie laufen, und beide werden von uns betrieben. Der Unterschied liegt vor allem im Grafikspeicher (VRAM) und damit in der Größe der Modelle, die sich sinnvoll betreiben lassen.
| Verda GPU S | Verda GPU L | |
|---|---|---|
| GPU | NVIDIA RTX 4000 SFF Ada | NVIDIA RTX PRO 6000 Blackwell |
| Grafikspeicher | 20 GB | 96 GB |
| Typischer Einsatz | Inference kleiner und mittlerer Modelle, RAG, Embeddings | Große Sprachmodelle, mehrere Modelle parallel, Fine-Tuning |
| Preis | ab 790 € pro Monat | ab 2.690 € pro Monat |
| Laufzeit | 12 Monate | 12 Monate |
| Einrichtung | nach Angebot | nach Angebot |
Alle Preise verstehen sich netto zuzüglich Umsatzsteuer. Für Anforderungen jenseits dieser Pakete, etwa mehrere GPUs oder besondere Netzwerk- und Speicheranforderungen, erstellen wir ein individuelles Enterprise-Angebot mit einem SLA von 99,9 %.
Welche Modelle passen auf welche GPU?
Als Richtwert gilt: Mit 20 GB VRAM lassen sich Sprachmodelle bis etwa 13 Milliarden Parameter in guter Qualität betreiben, mit Quantisierung auch etwas größere. Das reicht für viele Anwendungen wie Dokumentensuche, Zusammenfassungen oder interne Assistenten. Modelle der 70B-Klasse benötigen je nach Quantisierung deutlich mehr Speicher; hier ist die Verda GPU L mit 96 GB die passende Wahl. Details dazu finden Sie in unserem VRAM-Guide für KI-Modelle und im Vergleich RTX 4000 und RTX PRO 6000.
Was im Preis enthalten ist
Ein GPU-Server allein erzeugt noch keinen Nutzen. Entscheidend ist, dass Treiber, Laufzeitumgebung und Modelle zuverlässig laufen und jemand reagiert, wenn etwas nicht stimmt. Deshalb ist der Managed Betrieb fester Bestandteil jedes Pakets:
- Dedizierte Hardware in ISO-27001-zertifizierten Rechenzentren in Bayern und Sachsen, kein geteilter GPU-Pool
- Betriebssystem, NVIDIA-Treiber und CUDA installiert, gepflegt und aktualisiert
- Container-Laufzeit für Ihre KI-Anwendungen, auf Wunsch mit vLLM oder Ollama vorkonfiguriert
- Monitoring von GPU-Auslastung, Speicher und Diensten mit proaktivem Alerting
- Backups nach abgestimmter Strategie
- Netzwerk und Firewall nach dem Prinzip der minimalen Freigabe
- Hardwaretausch bei Defekt
- Fester Ansprechpartner per E-Mail und Telefon, Support auf Deutsch
- Auftragsverarbeitungsvertrag (AVV) nach DSGVO
Mehr zum Leistungsumfang lesen Sie auf der Seite Managed KI-Server.
Einflussfaktoren: was die Kosten bestimmt
Der Monatspreis ist ein Ab-Preis. Wie hoch Ihr Gesamtbudget ausfällt, hängt im Wesentlichen von fünf Faktoren ab:
- Modellgröße und VRAM-Bedarf: Die Wahl zwischen GPU S und GPU L ist der größte Hebel. Wer ein kleines Modell mit RAG kombiniert, kommt oft mit der kleineren Klasse aus.
- Parallele Nutzer und Durchsatz: Viele gleichzeitige Anfragen erfordern mehr Rechenleistung oder zusätzliche Server.
- Umfang der Einrichtung: Ein reiner Inference-Server ist schneller aufgesetzt als eine Umgebung mit Single Sign-on, RAG-Pipeline und Anbindung an Ihre Fachsysteme. Deshalb kalkulieren wir die Einrichtung nach Angebot.
- Speicher und Backups: Größere Dokumentenbestände, Vektordatenbanken und längere Aufbewahrungsfristen beeinflussen den Bedarf.
- Service-Level: Für geschäftskritische Anwendungen bieten wir im Enterprise-Paket ein SLA von 99,9 % mit erweiterten Reaktionszeiten.
Wenn Sie eine fertige Lösung statt eines reinen Servers suchen, etwa ein lokales Sprachmodell mit Gateway oder ein RAG-System, finden Sie alle Angebote in der Übersicht Preise und Pakete.
GPU-Server mieten vs. Pay-per-Use in der Cloud
Bei Hyperscalern und KI-APIs zahlen Sie nach Verbrauch: pro Stunde Rechenzeit oder pro verarbeitetem Token. Das ist für Experimente und stark schwankende Last sinnvoll. Für den dauerhaften Betrieb hat das Modell jedoch Nachteile.
| Kriterium | Managed GPU-Server (Festpreis) | Pay-per-Use-Cloud |
|---|---|---|
| Kostenverlauf | Fester Monatsbetrag | Steigt mit Nutzung und Laufzeit |
| Planbarkeit | Hoch, Budget steht vorab fest | Abhängig von Nutzungsverhalten |
| Ressourcen | Dedizierte GPU, keine Nachbarn | Häufig geteilte oder zeitweise knappe Kapazität |
| Betrieb | Durch Verdacloud | Meist in Eigenregie |
| Datenhaltung | Rechenzentren in Deutschland | Region wählbar, Anbieter oft US-Konzern |
| Stärke | Dauerbetrieb, sensible Daten | Kurze Tests, Lastspitzen |
Faustregel: Je gleichmäßiger und höher die Auslastung, desto eher rechnet sich der Festpreis. Einen ausführlichen Vergleich finden Sie unter Lokales LLM vs. OpenAI API.
So läuft die Bereitstellung ab
Nach einem kurzen Abstimmungsgespräch klären wir Modell, Nutzerzahl und Integrationen. Sie erhalten ein schriftliches Angebot mit Monatspreis und Einrichtungsumfang. Nach Auftragserteilung richten wir den Server ein, übergeben Zugänge und Dokumentation und übernehmen ab diesem Zeitpunkt den laufenden Betrieb. Wenn Sie vorab eine übergreifende KI-Strategie erarbeiten möchten, unterstützt Sie unsere Schwestermarke VerdaGen.ai.