Ausgabe 01 — ein VPS für LLMs · Registrierung offen
Miete die Maschine.
Nicht die Tokens.
Eine private LLM-Instanz auf EU-Hardware, zu einer festen Monatspauschale. Nichts zählt herunter und nichts wird zurückgesetzt — die einzigen Grenzen sind, wie viele Anfragen gleichzeitig laufen und wie viel Kontext jede davon bekommt. Beides legst du selbst fest.
Kein Token-Zähler.
Kein rollierendes Nutzungsfenster.
Keine Anfrage, die mitten in
deiner Aufgabe abbricht.
Keine Überraschung auf der Rechnung —
deine Instanz zu festen Kosten.
EU-Hardware, EU-Rechtsraum.
01 / Die Idee
Wer schon einmal einen Server gemietet hat, kennt dieses Produkt.
Ein Projekt bekommt ein VPL: einen Endpunkt, einen Key, zwei Zahlen zur Dimensionierung.
Ein Regler legt fest, wie viele Instanzen das Projekt betreibt — und eine Instanz ist eine Anfrage in Bearbeitung. Drei Instanzen heißt drei Dinge gleichzeitig: dein Agent, dein Editor, deine Testschleife. Ein zweiter Regler legt das Kontextfenster fest, das jede dieser Anfragen bekommt. Die API ist OpenAI-kompatibel — Cline, ZooCode, VS Code BYOK und dein eigenes Backend sprechen unverändert mit ihr.
-
01
Beim VPS — vCPU + RAM
Anzahl Instanzen
Zwei Regler. Innerhalb dieser Größe läuft, so viel du willst — den ganzen Tag.
-
02
Beim VPS — kein Anfragekontingent
Kein Nutzungsfenster
Nichts zählt herunter, nichts wird zurückgesetzt. Du wirst nie mitten in einer Aufgabe ausgesperrt.
-
03
Beim VPS — feste Monatsrechnung
Feste Monatsrechnung
Keine Überraschungen: Eine volle Woche kostet genauso viel wie eine ruhige. Tokens zählen wir für dich mit — abgerechnet werden sie nie.
-
04
Beim VPS — OS-Image
Open-Weight-Modell
Modell wählen und fixieren. Wechseln heißt: einen String ändern, keine Migration.
-
05
Beim VPS — ein Server, ein Host
Ein Projekt, ein VPL
Keys, Nutzung und Limits bleiben pro Projekt — nichts wird versehentlich geteilt.
-
06
Beim VPS — Rechenzentrumsregion
Nur EU-Region
Nichts verlässt den EU-Rechtsraum — DSGVO und AI Act sind hier Bauweise, nicht Nachrüstung.
02 / Umstieg
Zwei Minuten, zwei Felder.
Nichts zu installieren, nichts umzuschreiben.
-
01
Projekt anlegen
Ein Projekt ist ein VPL: eigener Endpunkt, eigener Key, eigene Nutzung. Benenn es nach dem, was es bedient.
-
02
Anzahl der Instanzen festlegen
Ein Regler entscheidet, wie viele Anfragen gleichzeitig laufen. Für eine Woche mit parallelen Agenten hoch, danach wieder runter. Das ist das ganze Kapazitätsmodell.
-
03
Dein Tool darauf richten
Base-URL und Key in Cline, ZooCode, VS Code BYOK oder ein beliebiges OpenAI-SDK. Sonst ändert sich nichts an deinem Setup.
export OPENAI_BASE_URL=https://api.solheim.ai/v1 export OPENAI_API_KEY=slh_live_9f3c… # über deine Instanzzahl hinaus werden Aufrufe eingereiht. # kein 429, keine Zusatzkosten.
03 / Souveränität
In der EU gehostet, auf jeder Ebene.
Souveränität ist eine Architektur, kein Häkchen.
-
01
Infrastruktur
GPUs bei EU-eigenen Anbietern in EU-Rechenzentren. Kein US-Hyperscaler im Serving-Pfad — also kein CLOUD-Act-Risiko, das du in deinen AVV schreiben müsstest.
-
02
Modelle
Offene Gewichte unter permissiven Lizenzen, pro Instanz fixiert und von uns betrieben. Deine Prompts sind keine Trainingsdaten — weder unsere noch die von irgendwem sonst.
-
03
Routing
Anfragen verlassen die Region nicht, und diese Seite lädt kein Byte von einem fremden Origin — kein US-CDN, kein Analytics, keine Schriften, die nach Hause telefonieren.
Die Bibliothek
-
01
Qwen3.6-35B-A3B
qwen3.6-35b-a3b
Der Standard für die tägliche Arbeit: Diffs, Tests, Refactorings und Agenten mit Tool-Calling. Ein Mixture-of-Experts-Modell: 35 Mrd. Parameter insgesamt, drei Milliarden davon aktiv pro Token — ein Preis-Leistungs-Verhältnis, das seinesgleichen sucht.
-
02
Qwen3.8-27B
qwen3.8-27b
Der Schritt nach oben: die neueste Ergänzung der Qwen-Familie, ein kompaktes Dense-Modell mit deutlichen Gewinnen in Coding, Facharbeit, Recherche und langlaufenden Agenten-Aufgaben.
-
03
DeepSeek V4 Flash
deepseek-v4-flash-0731
Open-Weight-Leistung nahe am Spitzenfeld, langer Kontext und Reasoning über lange Abschnitte, auf eigens für dich reservierter Rechenleistung.
-
+
Modell anfragen
offene Gewichte · permissive Lizenz
04 / Preise
Zwei Regler: wie viele, wie viel Kontext.
Instanzen × Kontextfenster × ein fester Monatssatz. Weiterhin keine Tokens, keine Stufen, keine Übernutzung — auf dieser Rechnung kann dich nichts überraschen.
- Context window
- 64k
- Modell
- eins pro Projekt
- Über deine Anzahl hinaus
- wird eingereiht, nie 429
- Übernutzung
- gibt es nicht
15,00 € /Monat · 1 × 64k × 15,00 €
Alle Preise netto, zzgl. gesetzlicher USt. Für Geschäftskunden mit USt-IdNr. innerhalb der EU gilt das Reverse-Charge-Verfahren.
In dieser Größe startenÜber zehn oder über 128k
Dediziert & Enterprise
Eine dedizierte GPU oder eine MIG-Partition davon — keine Nachbarn auf derselben Karte, kein Gedränge mit fremden Agenten. Ein 256k-Fenster gehört ebenfalls hierher: Es braucht das Vierfache an Cache der größten geteilten Größe und bekommt deshalb eine eigene Karte statt einer Warteschlange. Privates Networking, ein unterschriebener AVV und Rechnung statt Kreditkarte. Bepreist nach der Hardware, die du brauchst — nicht pro Anfrage.
Sprich uns an:
Kontakt aufnehmen05 / Publikum
Für wen das ist.
Gleiches Produkt, gleiche Regler, gleiche Rechnung.
-
01
Teams, die Coding-Agenten betreiben
Du lebst in Cline, ZooCode oder VS Code und stößt fast jede Woche ans Limit. Drei Instanzen sind ein Agent, ein Editor und eine Testschleife gleichzeitig — so lange der Tag dauert.
-
02
Gründer, die ein Inferenz-Backend brauchen
Dein Produkt braucht ein privates LLM dahinter, mit einer Rechnung, die gleich bleibt, egal wie der Traffic schwankt. Richte dein Backend auf denselben Endpunkt und dimensioniere es genauso.
Das ist ein Produkt, nicht zwei. Was sich zwischen diesen beiden ändert, ist nur, was du auf den Endpunkt richtest — nicht der Preis, nicht die API, nicht die Maschine.
06 / Beiträge