DIE MASCHINE IM DETAIL

Eine Appliance mit drei Schichten, ein Vertragspartner.

Die zenpAI-Appliance bringt Hardware, lokales Modell und Agenten-Orchestrierung in einem System zusammen, das auf Ihrer eigenen Infrastruktur läuft. Sicherheitsarchitektur, Stack, Hardware-Klassen und Betrieb im Detail.

§01

Sicherheit als Architektur.

KEIN ENDPUNKT · KEINE FREMDE JURISDIKTION

Sicherheit steckt bei uns in der Architektur: keine geteilte Cloud-Hardware, keine externe Inferenz, keine fremden Administratoren auf Ihren Daten. Ihre Daten bleiben bei Ihnen.

GDPR DSGVO Erfüllt die strengen DSGVO- & EU-AI-Act-Anforderungen. Kein US CLOUD Act, kein Drittland.
01

0 % Cloud-Exposition

Alle Inferenz, alle Modell-Gewichte, alle Trainings-Pipelines verbleiben auf Ihrer Hardware. Kein Sub-Prozessor, kein Drittland.

02

Lokales Audit-Log

Jede Anmeldung, jeder Tool-Aufruf und jede relevante Antwort wird lokal protokolliert. Das schafft Nachvollziehbarkeit für interne Kontrollen, Compliance-Prozesse und AI-Act-Dokumentation.

§02

Der Stack.

VON DER ANWENDUNG BIS ZUR HARDWARE

Sieben Schichten, eine Verantwortung. Unten ein gehärtetes Linux mit optimierten Treibern, darüber Kubernetes nach GitOps-Prinzip, versioniert und auditierbar. Ganz oben sitzt die Agenten-Schicht: Sie delegiert Aufgaben, hält Zustand, steuert Abläufe und setzt dabei die Governance. Bewährte Rechenzentrums-Software, keine Bastellösung.

§02 · B · ARCHITEKTUR

Was im Rack tatsächlich läuft, von der Anwendung bis zur Hardware.

ANWENDUNGEN Nutzeroberflächen, mit denen gearbeitet wird
OpenWebUIStreamlitJetBrains JunieMCP-Clients
AGENTEN-SCHICHT Orchestriert Prozesse und hält den Kontext
LangGraphModel Context ProtocolOAuth / LDAP / SSOlokales Audit-Log
INFERENZ- UND MODELLSCHICHT Führt lokale KI-Modelle effizient auf der GPU aus
vLLMllama.cppTensorRT-LLMSGLangLlamaQwenDeepSeekGLMKimiMistralLoRA-Pipeline
PLATTFORM Deployment, Updates und Betrieb
KubernetesArgoCDHelmGitOpsGehärtetes LinuxNVIDIA-Treiber / CUDAcontainerd
HARDWARE GPU-Server in Ihrem Rack
NVIDIA Enterprise-GPUDELL PowerEdgeAMD EPYCredundante PSU
§03

Hardware-Klassen.

EIN SIZING-MODELL · VRAM · TOPS · NUTZER · kW

Drei Baugrößen, an Ihrer Last ausgerichtet. Die Standardkonfiguration baut auf der aktuellen Blackwell-Generation auf. Finale GPU, VRAM und Netzteil-Redundanz legen wir nach Last- und Latenz-Profil gemeinsam fest.

SFOUNDATION / PILOT
GPU
1× NVIDIA RTX PRO 6000 · Blackwell
VRAM
96 GB
AI-Leistung
~4.000 TOPS
Leistung max
~1 kW
Nutzer
1–10
MPROFESSIONAL TEAM
GPU
4× NVIDIA RTX PRO 6000 · Blackwell
VRAM
384 GB
AI-Leistung
~16.000 TOPS
Leistung max
~3 kW
Nutzer
10–60
LCUSTOM ENTERPRISE
GPU
8× NVIDIA RTX PRO 6000 · Blackwell
VRAM
768 GB
AI-Leistung
~32.000 TOPS
Leistung max
~5,5 kW
Nutzer
60–200
IndividualMAXIMALE AUSBAUSTUFE
GPU
Individuell ausgelegt
VRAM
nach Bedarf
AI-Leistung
nach Bedarf
Leistung max
individuell
Nutzer
200+

Nutzerzahlen je nach Modell und Last. Die Appliance wächst mit: zusätzliche GPU-Leistung rüsten wir bei Bedarf nach. Auf Anfrage.

§04

Wie wir liefern.

VOM ERSTGESPRÄCH BIS PRODUKTIV · IN PHASEN

Hardware kaufen kann jeder. Der Aufwand steckt in Integration, Datenbereinigung und agentischen Workflows. Den nehmen wir Ihnen ab, von der Prozessaufnahme bis zum laufenden Betrieb, in klar abgegrenzten Phasen und abgerechnet pro Phase. Wie lange das dauert, hängt von Kunde und Umfang ab. Zeigt die erste Phase, dass es noch zu früh ist, sagen wir das, bevor Hardware bestellt wird.

VOR PROJEKTSTART

Beratung & Pilot

Bestandsaufnahme: wo drückt der Schuh, welche Daten, welche Tools? Wir wählen den ersten Use-Case und zeigen schnell ein konkretes Ergebnis. Danach können Sie abbrechen, ohne Diskussion.

PHASE 1

Analyse & Daten

Datenpfade aufnehmen, Ziele definieren. Der größte Teil ist Datenbereinigung: verstreute Bestände produktionsreif machen.

PHASE 2

Bau & Feintuning

Die Appliance wird ins Rack eingebaut und ans Netz gebracht. Das Modell wird auf Ihrer Domäne feinjustiert und für Ihre GPU quantisiert.

PHASE 3

Orchestrierung & Übergabe

Agenten-Schicht auf Ihren Prozess gesetzt, Pilotbetrieb, Schulung Ihrer IT, vollständige Übergabe. Sie übernehmen, wir bleiben auf Abruf. Kein Lock-in.

Klingt nach Ihrem Vorhaben? Erstgespräch vereinbaren

§05

Betrieb nach Go-Live.

BETRIEB · OPTIONAL BUCHBAR

Eine On-Premise-KI muss betrieben werden: überwacht, aktualisiert, gepflegt. Standardmäßig übergeben wir Ihnen alles vollständig, sodass Ihre IT selbst betreiben kann. Auf Wunsch übernehmen wir den Betrieb komplett, aus der Ferne, zu einem festen Monatspreis. Keine Token-Gebühren, keine Nutzungsabrechnung, keine Überraschungen.

IM SERVICE ENTHALTEN
  • Kontinuierliche Überwachung rund um die Uhr: GPU, Speicher, Latenzen, Systemstatus
  • Sicherheits- und System-Updates des gehärteten Linux-Stacks
  • Aktuelle, kuratierte Modelle: neue Generationen evaluieren wir laufend und stellen sie bereit
  • Remote-Support und Fehleranalyse
  • Hardware-Frühwarnung und Upgrade-Empfehlungen
ZUSATZBUCHUNGEN · PROJEKTBASIERT
  • Re-Training und RAG-Optimierung auf Ihren eigenen Daten
  • Individuelle Entwicklung und Integration
  • Vor-Ort-Einsätze nach Vereinbarung

Nicht im Monatspreis: die Hardware als einmaliger Kauf (siehe §04 Wirtschaftlichkeit) und bei größeren Konfigurationen die Kühlung. Den Monatspreis nennen wir auf Anfrage, er hängt an Hardware-Klasse und gewünschter Reaktionszeit.

Eine Appliance, ein Vertragspartner. Sprechen wir.

Hardware-Klasse, Modellfamilie und Integrationstiefe legen wir gemeinsam mit Ihnen fest, sobald wir Ihre Datenlage, Ihre Systeme und Ihren ersten Use-Case verstanden haben. Dafür gibt es bei uns keinen Konfigurator.

Erstgespräch vereinbaren →
Erstgespräch vereinbaren →