LLM Hosting: souverän & DSGVO-konform

LLM im Unternehmen selbst hosten

KI nutzen, ohne die Kontrolle abzugeben. Wir übernehmen dein LLM Hosting im eigenen Haus oder in der Cloud, auf Basis von vLLM und OpenWebUI. Deine Mitarbeitenden arbeiten mit einem ChatGPT-ähnlichen Werkzeug. Kein Prompt und kein Dokument verlässt dabei dein Unternehmen. Modell und Betriebsort wählst du selbst.

Daten bleiben im Haus

Weder Prompts noch Antworten verlassen deine Infrastruktur. Ideal für sensible Geschäfts- und Kundendaten.

DSGVO-konform & in der EU

Betrieb im eigenen Rechenzentrum oder in der NETWAYS Managed Services Cloud in Deutschland, statt Anbieter außerhalb der EU.

Freie Modellwahl

Open-Weight-Modelle für Kontrolle und Kosten oder Frontier-Modelle wie Claude und ChatGPT für maximale Leistung – du entscheidest.

Kosten im Griff

Open-Weight-Modelle decken rund 80 % der Fälle günstig ab, und das ohne Token-Überraschungen pro Anfrage.

Volle Flexibilität

Selbst betreiben, NMS Cloud nutzen oder beides kombinieren. Wechsle zudem jederzeit den Betriebsort oder das Modell.

Mehr Wert mit eigenen Daten

An internes Wissen angebunden (RAG) liefert die KI konkrete, belastbare Antworten statt generischer Floskeln.

Das Problem

KI soll genutzt werden, aber sensible Daten dürfen nicht in fremde Clouds. Genau dieser Konflikt bremst viele Projekte aus, oft unbewusst.

Daten verlassen das Haus

Bei ChatGPT, Claude & Co. landen Prompts und Dokumente bei Anbietern außerhalb der EU. Der Datenschutz wird dabei oft zu spät zum Thema.

Abhängigkeit & Kosten

Pro-Token-Abrechnung und Anbieter-Lock-in machen Kosten unkalkulierbar. Zudem kannst du Modell oder Betriebsort kaum frei wählen.

Wenig Mehrwert ohne Kontext

Eine generische KI kennt deine internen Daten nicht. Ohne Anbindung an eigenes Wissen bleiben die Antworten oberflächlich.

So läuft dein LLM Hosting Projekt ab

Vier Schritte, identisch zu jeder NETWAYS Lösung: von der Modellauswahl bis zum stabilen Betrieb deiner KI-Plattform.

Schritt 1

Analyse & Konzept

Wir klären deine Anwendungsfälle, Anforderungen an den Datenschutz und die vorhandene GPU-Hardware. Und wählen passende Modelle aus.

→ Du bekommst die richtige Modellgröße statt teurer Überdimensionierung.

"
Schritt 2

Aufbau & Integration

Wer sein LLM selbst hosten will, braucht ein Inference-Backend wie vLLM. Wir setzen es auf und stellen mit OpenWebUI eine vertraute Chat-Oberfläche bereit, im eigenen Rechenzentrum oder bei NETWAYS Managed Services.

→ Eine OpenAI-kompatible API und bestehende Tools lassen sich direkt anbinden.

"
Schritt 3

Inbetriebnahme & Datenanbindung

Die Plattform geht live. Auf Wunsch verbinden wir die KI über RAG mit deinem internen Wissen, damit sie auf echten Firmendaten antwortet.

→ Aus generischer KI wird ein Assistent, der dein Unternehmen kennt.

"
Schritt 4

Support & Betrieb

Auf Wunsch übernehmen wir Betrieb, Updates, Skalierung und GPU-Monitoring komplett (MyEngineer) oder wir schulen dein Team.

→ Deine KI bleibt stabil und aktuell, ohne eigenes Spezialisten-Team.

Bausteine deines LLM Hostings

Du entscheidest bei jedem Baustein, wie viel du selbst betreibst und wo du auf NETWAYS-Services zurückgreifst.

Eigenes LLM wählen

Modell wählen

Open-Weight-Modelle wie Llama, Mistral oder Qwen für Kontrolle und Kosten oder per API ein Frontier-Modell für maximale Leistung.

Effekt: die richtige Balance aus Datenschutz, Leistung und Kosten.

On-Premise oder EU-Cloud

Betriebsort wählen

Im eigenen Rechenzentrum für maximale Kontrolle oder in der NETWAYS Managed Services Cloud aus Deutschland, beides DSGVO-konform und innerhalb der EU.

Effekt: volle Datenkontrolle, ohne eigenes Hosting erzwingen zu müssen.

OpenWebUI & API

Oberfläche & Zugang

OpenWebUI als vertraute Chat-Oberfläche plus eine OpenAI-kompatible API, an die sich eigene Anwendungen direkt anbinden lassen.

Effekt: ein ChatGPT-Gefühl für Mitarbeitende, komplett intern.

Eigene Daten per RAG

Eigene Daten anbinden

Über RAG greift die KI auf Wissensdatenbanken, Dokumente und interne Systeme zu, die Quellen bleiben unter deiner Kontrolle.

Effekt: Antworten auf Basis deines echten Firmenwissens.

Das erreichst du mit LLM Hosting

Volle Datenkontrolle · Planbare Kosten · Echte Unabhängigkeit

Datensouveränität

Deine Daten bleiben im eigenen Haus oder in der EU. KI nutzen, ohne den Datenschutz zu riskieren.

Planbare Kosten

Open-Weight-Modelle auf eigener oder gemieteter Hardware statt Abrechnung pro Token. Kosten werden somit kalkulierbar.

Unabhängigkeit

Kein Lock-in: Modell, Betriebsort und Anbieter sind frei wählbar und jederzeit austauschbar.

Womit wird deine KI-Lösung gebaut

Wir verwenden bewährte Open Source Komponenten. Du entscheidest, welche Teile du selbst betreibst und wo du auf NETWAYS-Services zurückgreifst.

vLLM

Hochperformantes Inference-Backend für den produktiven LLM-Betrieb: hoher Durchsatz, effiziente GPU-Nutzung und eine OpenAI-kompatible API, komplett auf deiner Infrastruktur.

OpenWebUI

Self-hosted Chat-Oberfläche für LLMs: ein vertrautes, ChatGPT-ähnliches Werkzeug mit RAG- und Tool-Integration, das vollständig offline läuft.

n8n

Verbindet die KI über RAG und Automatisierung mit internen Systemen und stößt aus dem Chat heraus echte Aktionen an. Datenschutzkonform im eigenen Haus.

Grafana

Behält GPU-Auslastung, Durchsatz und Verfügbarkeit deiner KI-Plattform im Blick, damit der Betrieb planbar und stabil bleibt.

Was du schon nutzt, binden wir an

Deine KI-Plattform lässt sich frei zusammenstellen und an bestehende Systeme anbinden. Eine Auswahl der Bausteine und Schnittstellen, mit denen wir typischerweise arbeiten.

Modelle & Gewichte

  • Llama
  • Mistral
  • Qwen
  • DeepSeek
  • Gemma

Oberflächen & Zugang

  • OpenWebUI
  • OpenAI-kompatible API
  • VS Code / Claude Code
  • Eigene Anwendungen

Betrieb & Hardware

  • NMS Cloud (EU)
  • Eigenes Rechenzentrum
  • GPU-Server
  • Kubernetes / Docker
  • nws.netways.de

Inference & Serving

  • vLLM
  • Ollama
  • NMS AI
  • Hugging Face
  • OpenAI / Anthropic (API)

Eigene Daten (RAG)

  • PostgreSQL / pgvector
  • Qdrant
  • Elastic / OpenSearch
  • Nextcloud
  • SharePoint

Fragen & Antworten

Die meistgestellten Fragen zu dieser Lösung

Was ist LLM Hosting?

2
3

LLM Hosting bedeutet, ein Sprachmodell auf eigener oder gemieteter Infrastruktur zu betreiben, statt einen Cloud Dienst wie ChatGPT direkt zu nutzen. NETWAYS übernimmt dabei Aufbau und Betrieb, auf Basis von vLLM und OpenWebUI.

Wie kann ich ein LLM selbst hosten?

2
3

Für das LLM selbst hosten brauchst du GPU Hardware, ein Inference Backend wie vLLM und eine Chat Oberfläche wie OpenWebUI. NETWAYS übernimmt Auswahl, Aufbau und laufenden Betrieb, im eigenen Rechenzentrum oder in der NETWAYS Web Services Cloud.

Welche KI ist DSGVO-konform?

2
3

DSGVO konform ist eine KI vor allem dann, wenn die Daten unter deiner Kontrolle bleiben. Das gelingt am sichersten, wenn das Modell im eigenen Rechenzentrum oder in einer EU Cloud wie NETWAYS Managed Services läuft. NETWAYS richtet genau diesen souveränen Betrieb ein.

Ist ChatGPT DSGVO-konform?

2
3

Bei der direkten Nutzung von ChatGPT, Claude und Co. verlassen Eingaben in der Regel die EU. Das ist je nach Datenart kritisch. Wer Frontier Modelle nutzen will, kann das gezielt für unkritische Daten tun. Sensible Inhalte verarbeitet ein selbst gehostetes Open Weight Modell im eigenen Haus.

Was ist On-Premise-KI?

2
3

On-Premise-KI bedeutet, dass das Sprachmodell auf deiner eigenen Hardware im eigenen Rechenzentrum läuft, statt als Service in einer fremden Cloud. Du behältst die volle Kontrolle über Daten, Modell und Betrieb. NETWAYS setzt dafür vLLM und OpenWebUI auf.

Wie nutze ich KI datenschutzkonform?

2
3

Indem du Betriebsort und Modell bewusst wählst: Open-Weight-Modelle im eigenen RZ oder in der NETWAYS Managed Services Cloud aus Deutschland halten die Daten im Haus. Für eigene Inhalte sorgt eine RAG-Anbindung, bei der die Quellen unter deiner Kontrolle bleiben. So nutzt du KI produktiv, ohne Daten preiszugeben.

Brauche ich teure Modelle oder reichen Open-Weight-Modelle?

2
3
Für die meisten Anwendungsfälle reichen Open-Weight-Modelle wie Llama, Mistral oder Qwen vollkommen aus – sie decken rund 80 % der Fälle günstig ab. Frontier-Modelle lohnen sich gezielt dort, wo maximale Leistung nötig ist. Du kannst beides kombinieren und je Aufgabe entscheiden.

Was sind vLLM und OpenWebUI?

2
3

vLLM ist ein hochperformantes Inference Backend, das Open Source LLMs effizient auf deiner GPU Hardware betreibt. OpenWebUI ist die self hosted Chat Oberfläche dazu, ein vertrautes Werkzeug mit RAG und Tool Integration.

Wir freuen uns auf deine Nachricht






    captcha