Zum Inhalt springen
Verdacloud
menu
Verdacloud

KI-Server mieten: Preise für Managed GPU-Server in Deutschland

Einen Managed KI-Server von Verdacloud mieten Sie ab 790 € pro Monat (Verda GPU S) bzw. ab 2.690 € pro Monat (Verda GPU L), jeweils netto bei 12 Monaten Laufzeit. Im Preis enthalten sind dedizierte Hardware in ISO-27001-zertifizierten Rechenzentren in Deutschland und der laufende Betrieb durch unser Team; die Einrichtung kalkulieren wir nach Angebot.

KI-Server Preise: die zwei Pakete im Überblick

Wir bieten zwei klar definierte GPU-Klassen an. Beide sind dedizierte Server, die ausschließlich für Sie laufen, und beide werden von uns betrieben. Der Unterschied liegt vor allem im Grafikspeicher (VRAM) und damit in der Größe der Modelle, die sich sinnvoll betreiben lassen.

Verda GPU S Verda GPU L
GPU NVIDIA RTX 4000 SFF Ada NVIDIA RTX PRO 6000 Blackwell
Grafikspeicher 20 GB 96 GB
Typischer Einsatz Inference kleiner und mittlerer Modelle, RAG, Embeddings Große Sprachmodelle, mehrere Modelle parallel, Fine-Tuning
Preis ab 790 € pro Monat ab 2.690 € pro Monat
Laufzeit 12 Monate 12 Monate
Einrichtung nach Angebot nach Angebot

Alle Preise verstehen sich netto zuzüglich Umsatzsteuer. Für Anforderungen jenseits dieser Pakete, etwa mehrere GPUs oder besondere Netzwerk- und Speicheranforderungen, erstellen wir ein individuelles Enterprise-Angebot mit einem SLA von 99,9 %.

Welche Modelle passen auf welche GPU?

Als Richtwert gilt: Mit 20 GB VRAM lassen sich Sprachmodelle bis etwa 13 Milliarden Parameter in guter Qualität betreiben, mit Quantisierung auch etwas größere. Das reicht für viele Anwendungen wie Dokumentensuche, Zusammenfassungen oder interne Assistenten. Modelle der 70B-Klasse benötigen je nach Quantisierung deutlich mehr Speicher; hier ist die Verda GPU L mit 96 GB die passende Wahl. Details dazu finden Sie in unserem VRAM-Guide für KI-Modelle und im Vergleich RTX 4000 und RTX PRO 6000.

Was im Preis enthalten ist

Ein GPU-Server allein erzeugt noch keinen Nutzen. Entscheidend ist, dass Treiber, Laufzeitumgebung und Modelle zuverlässig laufen und jemand reagiert, wenn etwas nicht stimmt. Deshalb ist der Managed Betrieb fester Bestandteil jedes Pakets:

  • Dedizierte Hardware in ISO-27001-zertifizierten Rechenzentren in Bayern und Sachsen, kein geteilter GPU-Pool
  • Betriebssystem, NVIDIA-Treiber und CUDA installiert, gepflegt und aktualisiert
  • Container-Laufzeit für Ihre KI-Anwendungen, auf Wunsch mit vLLM oder Ollama vorkonfiguriert
  • Monitoring von GPU-Auslastung, Speicher und Diensten mit proaktivem Alerting
  • Backups nach abgestimmter Strategie
  • Netzwerk und Firewall nach dem Prinzip der minimalen Freigabe
  • Hardwaretausch bei Defekt
  • Fester Ansprechpartner per E-Mail und Telefon, Support auf Deutsch
  • Auftragsverarbeitungsvertrag (AVV) nach DSGVO

Mehr zum Leistungsumfang lesen Sie auf der Seite Managed KI-Server.

Einflussfaktoren: was die Kosten bestimmt

Der Monatspreis ist ein Ab-Preis. Wie hoch Ihr Gesamtbudget ausfällt, hängt im Wesentlichen von fünf Faktoren ab:

  1. Modellgröße und VRAM-Bedarf: Die Wahl zwischen GPU S und GPU L ist der größte Hebel. Wer ein kleines Modell mit RAG kombiniert, kommt oft mit der kleineren Klasse aus.
  2. Parallele Nutzer und Durchsatz: Viele gleichzeitige Anfragen erfordern mehr Rechenleistung oder zusätzliche Server.
  3. Umfang der Einrichtung: Ein reiner Inference-Server ist schneller aufgesetzt als eine Umgebung mit Single Sign-on, RAG-Pipeline und Anbindung an Ihre Fachsysteme. Deshalb kalkulieren wir die Einrichtung nach Angebot.
  4. Speicher und Backups: Größere Dokumentenbestände, Vektordatenbanken und längere Aufbewahrungsfristen beeinflussen den Bedarf.
  5. Service-Level: Für geschäftskritische Anwendungen bieten wir im Enterprise-Paket ein SLA von 99,9 % mit erweiterten Reaktionszeiten.

Wenn Sie eine fertige Lösung statt eines reinen Servers suchen, etwa ein lokales Sprachmodell mit Gateway oder ein RAG-System, finden Sie alle Angebote in der Übersicht Preise und Pakete.

GPU-Server mieten vs. Pay-per-Use in der Cloud

Bei Hyperscalern und KI-APIs zahlen Sie nach Verbrauch: pro Stunde Rechenzeit oder pro verarbeitetem Token. Das ist für Experimente und stark schwankende Last sinnvoll. Für den dauerhaften Betrieb hat das Modell jedoch Nachteile.

Kriterium Managed GPU-Server (Festpreis) Pay-per-Use-Cloud
Kostenverlauf Fester Monatsbetrag Steigt mit Nutzung und Laufzeit
Planbarkeit Hoch, Budget steht vorab fest Abhängig von Nutzungsverhalten
Ressourcen Dedizierte GPU, keine Nachbarn Häufig geteilte oder zeitweise knappe Kapazität
Betrieb Durch Verdacloud Meist in Eigenregie
Datenhaltung Rechenzentren in Deutschland Region wählbar, Anbieter oft US-Konzern
Stärke Dauerbetrieb, sensible Daten Kurze Tests, Lastspitzen

Faustregel: Je gleichmäßiger und höher die Auslastung, desto eher rechnet sich der Festpreis. Einen ausführlichen Vergleich finden Sie unter Lokales LLM vs. OpenAI API.

So läuft die Bereitstellung ab

Nach einem kurzen Abstimmungsgespräch klären wir Modell, Nutzerzahl und Integrationen. Sie erhalten ein schriftliches Angebot mit Monatspreis und Einrichtungsumfang. Nach Auftragserteilung richten wir den Server ein, übergeben Zugänge und Dokumentation und übernehmen ab diesem Zeitpunkt den laufenden Betrieb. Wenn Sie vorab eine übergreifende KI-Strategie erarbeiten möchten, unterstützt Sie unsere Schwestermarke VerdaGen.ai.

Häufige Fragen

Was kostet ein KI-Server pro Monat?
Die Verda GPU S mit NVIDIA RTX 4000 SFF Ada (20 GB) gibt es ab 790 € pro Monat, die Verda GPU L mit NVIDIA RTX PRO 6000 Blackwell (96 GB) ab 2.690 € pro Monat. Die Preise gelten netto bei 12 Monaten Laufzeit, der Managed Betrieb ist enthalten.
Warum wird die Einrichtung nach Angebot berechnet?
Der Aufwand unterscheidet sich stark: Ein Inference-Server mit einem Standardmodell ist schnell eingerichtet, eine Umgebung mit Single Sign-on, RAG und Anbindung an Fachsysteme deutlich aufwendiger. Mit einem individuellen Angebot zahlen Sie nur für den Umfang, den Sie tatsächlich benötigen.
Kann ich später von GPU S auf GPU L wechseln?
Ja, ein Wechsel auf die größere Klasse ist möglich, wenn Ihre Anforderungen wachsen. Wir migrieren Konfiguration und Daten und stimmen den Zeitpunkt mit Ihnen ab.
Ist ein gemieteter GPU-Server günstiger als die Cloud?
Das hängt von der Auslastung ab. Bei dauerhaftem, gleichmäßigem Betrieb ist ein Festpreis meist besser planbar und häufig wirtschaftlicher; für kurze Tests oder seltene Nutzung kann Pay-per-Use sinnvoller sein. Wir rechnen Ihr Szenario gern gemeinsam durch.
Wo stehen die Server?
Alle Server laufen in ISO-27001-zertifizierten Rechenzentren in Bayern und Sachsen. Ihre Daten bleiben in Deutschland, die Verarbeitung erfolgt auf Grundlage eines Auftragsverarbeitungsvertrags nach DSGVO.
Beratung & Umsetzung

Sie brauchen zuerst eine Strategie oder einen Use Case?

Analyse, Konzeption und Projektumsetzung übernimmt unsere Schwestermarke VerdaGen.ai — die Infrastruktur dafür betreiben wir hier bei Verdacloud.

Anfrage

Sprechen wir über Ihre Anforderungen.

Nennen Sie uns Workload, Datenmenge und Nutzerzahl — Sie erhalten ein konkretes Angebot mit Festpreis.