Private AI – DSGVO-konform & souverän

SI-KI Plattform – Ihre GPU-Plattform für AI-Inference

Unsere GPU-Plattform für AI-Inference: 2× bis 6× High-End GPUs, genug VRAM für große KI-Modelle und eine betriebsfertige Completion-API – aufgebaut wie ein Kryptominer, betrieben in unseren eigenen Rechenzentrumsräumen in Karlsruhe. Sie greifen per API zu, die Hardware bleibt bei uns. Daten verlassen nie unsere Infrastruktur.

SI-KI Plattform – Ihre GPU-Plattform für AI-Inference
Was Sie bekommen

2× bis 6× High-End GPUs als betriebsfertige Box

Wir liefern keine abstrakte Cloud. Sie bekommen eine physisch bei uns betriebene GPU-Box mit bis zu sechs High-End GPUs, massig VRAM und modernster Inference-Software – direkt einsatzbereit inklusive API-Zugang.

2× bis 6× High-End GPUs
Genug VRAM für große KI-Modelle
Box-Aufbau wie bei Kryptominern
Modelle & Technologien automatisch aktualisiert
Eigene Server – selbst gebaut & betrieben
Completion-API – betriebsbereit in Tagen

Was es kann

10× Nutzer parallel

Schnell genug für 10 gleichzeitige Nutzer – ohne dass die Performance einbricht.

Echtzeit-Antworten

Antworten in Echtzeit – auch bei parallelen Anfragen und komplexen KI-Modellen.

100% DSGVO & souverän

Ihre Daten verlassen nie unsere Infrastruktur in Karlsruhe. Keine Cloud, kein Datenabfluss an Dritte, volle Kontrolle.

Fixkosten statt pro-Token

Einmalige Hardware + Strom oder Flatrate – kein pro-Token-Preis, keine überraschenden Rechnungen.

Der Status Quo in KMU

Warum klassische KI-Lösungen an ihre Grenzen stoßen

KI ist technisch längst bereit für autonome Prozesse, 24/7-Agenten und Wissensabfragen. Doch klassische Cloud-KI blockiert den Mittelstand – aus Kosten-, Datenschutz- und Integrationsgründen.

Cloud-Kosten eskalieren

Jeder Use-Case, jeder Token kostet extra. Die Rechnung wächst mit dem Geschäftsvolumen – unbegrenzt und schwer planbar.

Daten verlassen das Unternehmen

Cloud-KI verarbeitet sensible Daten auf fremden Servern. DSGVO-Risiko, keine Kontrolle über Datenflüsse, keine echte Souveränität.

Systemwechsel frisst Zeit

Mitarbeiter springen zwischen 5+ Systemen: CRM, Buchhaltung, E-Mail, DMS. Jeder Wechsel kostet Konzentration und Produktivität.

KI-Potenzial bleibt ungenutzt

Autonome Prozesse, 24/7-Agenten, Wissensabfrage – alles technisch möglich, aber Cloud-Abhängigkeit blockiert den Einsatz.

Unsere Lösung

Souveräne KI-Plattform, die alles verbindet

Daten verlassen unsere Server nie

Wettbewerbsschutz durch physische Kontrolle über alle KI-Komponenten in unserem Rechenzentrum. Ihre Daten bleiben in unserer Infrastruktur in Karlsruhe.

Digitale Souveränität

Keine Abhängigkeit von OpenAI, Anthropic, Google. Keine API-Sperren, keine Preiswillkür, keine fremde Infrastruktur.

DSGVO-konform

Keine Verarbeitung in Drittländern. Keine Datenübermittlung an Cloud-Anbieter. Volle Compliance aus Karlsruhe.

Rollenbasiert

Zugriff ausschließlich über Ihre Completion-API. Jeder Mitarbeiter sieht nur, was er darf. Auditierbar und nachvollziehbar.

Open-Source & Open-Weighted Modelle

Modelle und Software sind nachvollziehbar. Keine Blackbox, kein Vendor-Lock-in, volle Transparenz.

Audit-Log

Jede KI-Aktion wird protokolliert. Vollständige Nachvollziehbarkeit für Compliance und Sicherheit.

EU AI Act

Konformitäts-Check möglich. Vorbereitet auf kommende Regulierungen und regulatorische Anforderungen.

Cloud-KI-Kosten explodieren – Flatrate statt pro Token

Kostenfaktor Cloud (OpenAI & Co.) SI-KI Plattform

Preis pro Monat (100 Nutzer, moderat)

~2.500–5.000 €

79–719 € Flatrate – inkl. bis zu 300 Mio Output-Tokens

Beispiel: 300 Mio Output-Tokens

~2.700 € (GPT-4o Preisniveau)

719 € (Tier 3: Agent Cluster Max) – ca. 73 % Ersparnis

Kontextlänge pro Anfrage

meist nur 128.000 Token

262.144 Token – auf jeder Flatrate-Stufe

Kostenplanung

Jeder Token kostet extra – unbegrenzt und unberechenbar

Feste Pauschale mit Token-Deckel, Überziehung nur 0,75 €/Mio

Datensouveränität

Daten verlassen das Unternehmen

100 % lokal in Karlsruhe & DSGVO-konform

Preisgarantie

Preisänderungen jederzeit möglich

Alle Preise zzgl. 19 % MwSt., keine versteckten Kosten

Preise

PaaS-Flatrates

Monatliche Pauschale mit fester Token-Obergrenze – planbare Fixkosten statt pro-Token-Abrechnung. Jeder Tarif bietet bis zu 262.144 Token Kontext pro Anfrage – mehr Kontext als die meisten Cloud-APIs überhaupt anbieten. Alle Preise zzgl. 19 % MwSt. Zusätzliche Tokens über das Limit: 0,75 € pro 1 Mio Output-Tokens.

Solo

Tier 1: Agent Solo

Für Einzelentwickler & einen Agenten-Seat

  • 30 Mio Output-Tokens / Monat (zzgl. 19 % MwSt.)
  • 150 Mio Input-Tokens inklusive
  • 1 gleichzeitige Session
  • 262.144 Token Kontext pro Anfrage
  • Bis ~130 Tokens/Sekunde Generation (Code & strukturierte Ausgaben)
79 € / Monat
Parallelisierung 1 Session
PP (Prefill) ~4.000 t/s
TG (Generation) 70–130 t/s
Agent Solo anfragen
Team

Tier 2: Agent Team

Für Agenten- & Dev-Teams mit 3–5 Seats

  • 100 Mio Output-Tokens / Monat (zzgl. 19 % MwSt.)
  • 500 Mio Input-Tokens inklusive
  • 2–3 gleichzeitige Sessions
  • 262.144 Token Kontext pro Anfrage
  • 2 Instanzen à bis ~130 Tokens/Sekunde
249 € / Monat
Parallelisierung 2–3 Sessions
PP (Prefill) 2× ~4.000 t/s
TG (Generation) 2× 70–130 t/s
Agent Team anfragen
Cluster

Tier 3: Agent Cluster Max

Agenten-Farmen, 24/7-Autonome & Batch-Verarbeitung

  • 300 Mio Output-Tokens / Monat (zzgl. 19 % MwSt.)
  • 1,5 Mrd Input-Tokens inklusive
  • 4 gleichzeitige Sessions
  • 262.144 Token Kontext je Session
  • ~400–450 Tokens/Sekunde aggregiert
719 € / Monat
Parallelisierung 4 Sessions
PP (Prefill) ~10.000 t/s agg.
TG (Generation) ~400–450 t/s agg.
Agent Cluster anfragen
Prozess

So starten Sie Ihre KI-Plattform

01

Anforderungsanalyse

Wir besprechen Ihre KI-Use-Cases, Modellgrößen, Datenvolumen und Latenzanforderungen. Dabei ermitteln wir die passende GPU-Konfiguration und das passende Preismodell.

02

Infrastruktur-Setup

Wir bauen Ihre GPU-Box auf, installieren CUDA, vLLM, sglang und setzen Tensorparallelisierung ein. Ihre Server werden in unserer eigenen Infrastruktur in Karlsruhe betrieben.

03

API-Integration

Wir richten die Completion-API für Sie ein und stellen Ihnen Zugangsdaten sowie Dokumentation bereit – betriebsbereit in Tagen, nicht in Wochen.

04

Go-Live & Monitoring

Nach dem Go-Live überwachen wir Performance, Auslastung und Stabilität. Modelle und Technologien werden regelmäßig aktualisiert – ohne dass Sie es merken.

Kundenstimmen

Das sagen Unternehmen über die SI-KI Plattform

Langfristige Partnerschaften sind das Herzstück unserer Arbeit. Hier erzählen Auftraggeber aus dem Mittelstand, wie sie unsere Private-AI-Infrastruktur erleben:

Endlich eine lokale KI-Infrastruktur, die wir kontrollieren. Die Kosten sind planbar, sensible Daten verlassen die Infrastruktur von sobek nicht – und der Support versteht wirklich KI.

Dr. Peter Lang
Leiter Digitale Transformation, Finanzdienstleister

Der Umzug unserer internen KI-Pipeline in die SI-KI Plattform hat uns Planbarkeit zurückgegeben. Keine überraschenden Cloud-Rechnungen mehr.

Lisa Hoffmann
CIO, mittelständisches Industrieunternehmen

Für unsere Patientendokumentation brauchten wir eine DSGVO-konforme KI. sobek innovations hat innerhalb weniger Tage eine API-basierte Lösung bereitgestellt.

Markus Weber
Leiter IT, Gesundheitsdienstleister
FAQ

Häufig gestellte Fragen zur SI-KI Plattform

Sie haben Fragen zur Private-AI-Plattform? Hier klären wir die wichtigsten Punkte zu Infrastruktur, API, Preisen und Datenschutz.

Was genau ist die SI-KI Plattform?
Die SI-KI Plattform ist eine physische GPU-Infrastruktur in unserem eigenen Rechenzentrum in Karlsruhe, die wir selbst betreiben. Sie bekommen Zugang über eine Completion-API und können große KI-Modelle für AI-Inference nutzen – DSGVO-konform und ohne Datenabfluss.
Wie funktioniert der API-Zugang?
Wir richten für Sie eine Completion-API ein, kompatibel zu gängigen OpenAI-ähnlichen Schnittstellen. Sie erhalten Zugangsdaten und Dokumentation und können die API innerhalb Ihrer Anwendungen oder Agenten nutzen – betriebsbereit in Tagen.
Sind die Kosten wirklich fix – was passiert bei Überschreitung des Token-Limits?
Sie zahlen die monatliche Pauschale, unabhängig davon, wie viele Nutzer parallel arbeiten. Wird das Token-Limit überschritten, rechnen wir zusätzliche Output-Tokens mit 0,75 € pro 1 Mio ab – transparent und ohne automatische Zwangsdrosselung. Alternativ drosseln wir auf Wunsch bewusst.
Warum werden Output- und Input-Tokens getrennt behandelt?
Output-Tokens (generierte Antworten) sind der teuerste Ressourcenfaktor, da sie die GPU-Rechenzeit dominieren. Deshalb deckeln wir nur Output-Tokens. Input-Tokens (Ihre Prompts, Dokumente, Agenten-Kontexte) sind im Verhältnis 5:1 inklusive – wiederholter Input wird über Prefix-Caching praktisch kostenlos.
Was bedeutet ‚Session' bei den Flatrate-Tiers?
Eine Session ist ein gleichzeitiger, in sich zusammenhängender Agenten- oder Chat-Kontext mit bis zu 262.144 Token. Tier 1 erlaubt 1 Session gleichzeitig, Tier 2 erlaubt 2–3 Sessions, Tier 3 bis zu 4 Sessions mit voller Kontextlänge – parallel auf 4 High-End GPUs.
Wie wird die DSGVO-Einhaltung garantiert?
Alle Server stehen in unseren eigenen Räumen in Deutschland. Daten verlassen zu keinem Zeitpunkt unsere Infrastruktur oder werden an Cloud-Anbieter übermittelt. Zusätzlich bieten wir rollenbasierte Zugriffskontrolle, Audit-Logs und Unterstützung bei EU-AI-Act-Konformität.
Welche Modelle und Technologien kommen zum Einsatz?
Wir setzen auf moderne Open-Source und Open-Weighted Modelle sowie Inference-Engines wie vLLM und sglang mit Tensorparallelisierung. Modelle und Technologien werden regelmäßig aktualisiert, damit Sie von neuen Entwicklungen profitieren.
Kontakt

Lass uns über Ihre KI-Plattform sprechen

Schreiben Sie uns direkt – Rafael meldet sich bei Ihnen.

Rafael Sobek

Rafael Sobek

Dein Experte für digitale Lösungen

Mitgründer, Geschäftsführer und Stratege. Als Produkt- und Geschäftsstratege treibt er die Entwicklung neuer digitaler Dienstleistungen voran. Fachexperte für Softwarearchitekturen, KI und digitale Geschäftsprozesse.

Antwort innerhalb eines Werktags.

Deine Angaben werden verschlüsselt übertragen und ausschließlich zur Kontaktaufnahme verwendet.

Bereit für souveräne KI-Infrastruktur aus Karlsruhe?

Steigen Sie jetzt in die SI-KI Plattform ein: planbare Kosten, unsere eigene Hardware in Karlsruhe, keine Datenabflüsse. Starten Sie mit einem unverbindlichen Gespräch – wir finden gemeinsam das passende Modell.

Erreichbarkeit: Mo–Fr 9:00–17:00 Uhr | Antwort innerhalb von 24 Stunden