LLM Hosting: souverän & DSGVO-konform
LLM im Unternehmen selbst hosten
Daten bleiben im Haus
Weder Prompts noch Antworten verlassen deine Infrastruktur. Ideal für sensible Geschäfts- und Kundendaten.
DSGVO-konform & in der EU
Betrieb im eigenen Rechenzentrum oder in der NETWAYS Managed Services Cloud in Deutschland, statt Anbieter außerhalb der EU.
Freie Modellwahl
Open-Weight-Modelle für Kontrolle und Kosten oder Frontier-Modelle wie Claude und ChatGPT für maximale Leistung – du entscheidest.
Kosten im Griff
Open-Weight-Modelle decken rund 80 % der Fälle günstig ab, und das ohne Token-Überraschungen pro Anfrage.
Volle Flexibilität
Selbst betreiben, NMS Cloud nutzen oder beides kombinieren. Wechsle zudem jederzeit den Betriebsort oder das Modell.
Mehr Wert mit eigenen Daten
An internes Wissen angebunden (RAG) liefert die KI konkrete, belastbare Antworten statt generischer Floskeln.
Das Problem
KI soll genutzt werden, aber sensible Daten dürfen nicht in fremde Clouds. Genau dieser Konflikt bremst viele Projekte aus, oft unbewusst.
Daten verlassen das Haus
Bei ChatGPT, Claude & Co. landen Prompts und Dokumente bei Anbietern außerhalb der EU. Der Datenschutz wird dabei oft zu spät zum Thema.
Abhängigkeit & Kosten
Pro-Token-Abrechnung und Anbieter-Lock-in machen Kosten unkalkulierbar. Zudem kannst du Modell oder Betriebsort kaum frei wählen.
Wenig Mehrwert ohne Kontext
Eine generische KI kennt deine internen Daten nicht. Ohne Anbindung an eigenes Wissen bleiben die Antworten oberflächlich.
So läuft dein LLM Hosting Projekt ab
Vier Schritte, identisch zu jeder NETWAYS Lösung: von der Modellauswahl bis zum stabilen Betrieb deiner KI-Plattform.
Analyse & Konzept
Wir klären deine Anwendungsfälle, Anforderungen an den Datenschutz und die vorhandene GPU-Hardware. Und wählen passende Modelle aus.
→ Du bekommst die richtige Modellgröße statt teurer Überdimensionierung.
Aufbau & Integration
Wer sein LLM selbst hosten will, braucht ein Inference-Backend wie vLLM. Wir setzen es auf und stellen mit OpenWebUI eine vertraute Chat-Oberfläche bereit, im eigenen Rechenzentrum oder bei NETWAYS Managed Services.
→ Eine OpenAI-kompatible API und bestehende Tools lassen sich direkt anbinden.
Inbetriebnahme & Datenanbindung
Die Plattform geht live. Auf Wunsch verbinden wir die KI über RAG mit deinem internen Wissen, damit sie auf echten Firmendaten antwortet.
→ Aus generischer KI wird ein Assistent, der dein Unternehmen kennt.
Support & Betrieb
Auf Wunsch übernehmen wir Betrieb, Updates, Skalierung und GPU-Monitoring komplett (MyEngineer) oder wir schulen dein Team.
→ Deine KI bleibt stabil und aktuell, ohne eigenes Spezialisten-Team.
Bausteine deines LLM Hostings
Du entscheidest bei jedem Baustein, wie viel du selbst betreibst und wo du auf NETWAYS-Services zurückgreifst.
Modell wählen
Open-Weight-Modelle wie Llama, Mistral oder Qwen für Kontrolle und Kosten oder per API ein Frontier-Modell für maximale Leistung.
Effekt: die richtige Balance aus Datenschutz, Leistung und Kosten.
Betriebsort wählen
Im eigenen Rechenzentrum für maximale Kontrolle oder in der NETWAYS Managed Services Cloud aus Deutschland, beides DSGVO-konform und innerhalb der EU.
Effekt: volle Datenkontrolle, ohne eigenes Hosting erzwingen zu müssen.
Oberfläche & Zugang
OpenWebUI als vertraute Chat-Oberfläche plus eine OpenAI-kompatible API, an die sich eigene Anwendungen direkt anbinden lassen.
Effekt: ein ChatGPT-Gefühl für Mitarbeitende, komplett intern.
Eigene Daten anbinden
Über RAG greift die KI auf Wissensdatenbanken, Dokumente und interne Systeme zu, die Quellen bleiben unter deiner Kontrolle.
Effekt: Antworten auf Basis deines echten Firmenwissens.
Das erreichst du mit LLM Hosting
Volle Datenkontrolle · Planbare Kosten · Echte Unabhängigkeit
Datensouveränität
Deine Daten bleiben im eigenen Haus oder in der EU. KI nutzen, ohne den Datenschutz zu riskieren.
Planbare Kosten
Open-Weight-Modelle auf eigener oder gemieteter Hardware statt Abrechnung pro Token. Kosten werden somit kalkulierbar.
Unabhängigkeit
Kein Lock-in: Modell, Betriebsort und Anbieter sind frei wählbar und jederzeit austauschbar.
Womit wird deine KI-Lösung gebaut
Wir verwenden bewährte Open Source Komponenten. Du entscheidest, welche Teile du selbst betreibst und wo du auf NETWAYS-Services zurückgreifst.
vLLM
Hochperformantes Inference-Backend für den produktiven LLM-Betrieb: hoher Durchsatz, effiziente GPU-Nutzung und eine OpenAI-kompatible API, komplett auf deiner Infrastruktur.
OpenWebUI
Self-hosted Chat-Oberfläche für LLMs: ein vertrautes, ChatGPT-ähnliches Werkzeug mit RAG- und Tool-Integration, das vollständig offline läuft.
n8n
Verbindet die KI über RAG und Automatisierung mit internen Systemen und stößt aus dem Chat heraus echte Aktionen an. Datenschutzkonform im eigenen Haus.
Grafana
Behält GPU-Auslastung, Durchsatz und Verfügbarkeit deiner KI-Plattform im Blick, damit der Betrieb planbar und stabil bleibt.
Was du schon nutzt, binden wir an
Deine KI-Plattform lässt sich frei zusammenstellen und an bestehende Systeme anbinden. Eine Auswahl der Bausteine und Schnittstellen, mit denen wir typischerweise arbeiten.
Modelle & Gewichte
- Llama
- Mistral
- Qwen
- DeepSeek
- Gemma
Oberflächen & Zugang
- OpenWebUI
- OpenAI-kompatible API
- VS Code / Claude Code
- Eigene Anwendungen
Betrieb & Hardware
- NMS Cloud (EU)
- Eigenes Rechenzentrum
- GPU-Server
- Kubernetes / Docker
- nws.netways.de
Inference & Serving
- vLLM
- Ollama
- NMS AI
- Hugging Face
- OpenAI / Anthropic (API)
Eigene Daten (RAG)
- PostgreSQL / pgvector
- Qdrant
- Elastic / OpenSearch
- Nextcloud
- SharePoint
Fragen & Antworten
Die meistgestellten Fragen zu dieser Lösung
Was ist LLM Hosting?
LLM Hosting bedeutet, ein Sprachmodell auf eigener oder gemieteter Infrastruktur zu betreiben, statt einen Cloud Dienst wie ChatGPT direkt zu nutzen. NETWAYS übernimmt dabei Aufbau und Betrieb, auf Basis von vLLM und OpenWebUI.
Wie kann ich ein LLM selbst hosten?
Für das LLM selbst hosten brauchst du GPU Hardware, ein Inference Backend wie vLLM und eine Chat Oberfläche wie OpenWebUI. NETWAYS übernimmt Auswahl, Aufbau und laufenden Betrieb, im eigenen Rechenzentrum oder in der NETWAYS Web Services Cloud.
Welche KI ist DSGVO-konform?
DSGVO konform ist eine KI vor allem dann, wenn die Daten unter deiner Kontrolle bleiben. Das gelingt am sichersten, wenn das Modell im eigenen Rechenzentrum oder in einer EU Cloud wie NETWAYS Managed Services läuft. NETWAYS richtet genau diesen souveränen Betrieb ein.
Ist ChatGPT DSGVO-konform?
Bei der direkten Nutzung von ChatGPT, Claude und Co. verlassen Eingaben in der Regel die EU. Das ist je nach Datenart kritisch. Wer Frontier Modelle nutzen will, kann das gezielt für unkritische Daten tun. Sensible Inhalte verarbeitet ein selbst gehostetes Open Weight Modell im eigenen Haus.
Was ist On-Premise-KI?
On-Premise-KI bedeutet, dass das Sprachmodell auf deiner eigenen Hardware im eigenen Rechenzentrum läuft, statt als Service in einer fremden Cloud. Du behältst die volle Kontrolle über Daten, Modell und Betrieb. NETWAYS setzt dafür vLLM und OpenWebUI auf.
Wie nutze ich KI datenschutzkonform?
Indem du Betriebsort und Modell bewusst wählst: Open-Weight-Modelle im eigenen RZ oder in der NETWAYS Managed Services Cloud aus Deutschland halten die Daten im Haus. Für eigene Inhalte sorgt eine RAG-Anbindung, bei der die Quellen unter deiner Kontrolle bleiben. So nutzt du KI produktiv, ohne Daten preiszugeben.
Brauche ich teure Modelle oder reichen Open-Weight-Modelle?
Was sind vLLM und OpenWebUI?
vLLM ist ein hochperformantes Inference Backend, das Open Source LLMs effizient auf deiner GPU Hardware betreibt. OpenWebUI ist die self hosted Chat Oberfläche dazu, ein vertrautes Werkzeug mit RAG und Tool Integration.