Ausgabe 01 — ein VPS für LLMs · Registrierung offen

Miete die Maschine.
Nicht die Tokens.

Eine E-Mail mit einem Link, um dein Passwort zu setzen. Kein Newsletter, keine Drip-Kampagne.

So funktioniert's

Eine private LLM-Instanz auf EU-Hardware, zu einer festen Monatspauschale. Nichts zählt herunter und nichts wird zurückgesetzt — die einzigen Grenzen sind, wie viele Anfragen gleichzeitig laufen und wie viel Kontext jede davon bekommt. Beides legst du selbst fest.

Kein Token-Zähler.
Kein rollierendes Nutzungsfenster.
Keine Anfrage, die mitten in
deiner Aufgabe abbricht.
Keine Überraschung auf der Rechnung —
deine Instanz zu festen Kosten.
EU-Hardware, EU-Rechtsraum.

01 / Die Idee

Wer schon einmal einen Server gemietet hat, kennt dieses Produkt.

Ein Projekt bekommt ein VPL: einen Endpunkt, einen Key, zwei Zahlen zur Dimensionierung.

Ein Regler legt fest, wie viele Instanzen das Projekt betreibt — und eine Instanz ist eine Anfrage in Bearbeitung. Drei Instanzen heißt drei Dinge gleichzeitig: dein Agent, dein Editor, deine Testschleife. Ein zweiter Regler legt das Kontextfenster fest, das jede dieser Anfragen bekommt. Die API ist OpenAI-kompatibel — Cline, ZooCode, VS Code BYOK und dein eigenes Backend sprechen unverändert mit ihr.

  1. 01

    Beim VPS — vCPU + RAM

    Anzahl Instanzen

    Zwei Regler. Innerhalb dieser Größe läuft, so viel du willst — den ganzen Tag.

  2. 02

    Beim VPS — kein Anfragekontingent

    Kein Nutzungsfenster

    Nichts zählt herunter, nichts wird zurückgesetzt. Du wirst nie mitten in einer Aufgabe ausgesperrt.

  3. 03

    Beim VPS — feste Monatsrechnung

    Feste Monatsrechnung

    Keine Überraschungen: Eine volle Woche kostet genauso viel wie eine ruhige. Tokens zählen wir für dich mit — abgerechnet werden sie nie.

  4. 04

    Beim VPS — OS-Image

    Open-Weight-Modell

    Modell wählen und fixieren. Wechseln heißt: einen String ändern, keine Migration.

  5. 05

    Beim VPS — ein Server, ein Host

    Ein Projekt, ein VPL

    Keys, Nutzung und Limits bleiben pro Projekt — nichts wird versehentlich geteilt.

  6. 06

    Beim VPS — Rechenzentrumsregion

    Nur EU-Region

    Nichts verlässt den EU-Rechtsraum — DSGVO und AI Act sind hier Bauweise, nicht Nachrüstung.

02 / Umstieg

Zwei Minuten, zwei Felder.

Nichts zu installieren, nichts umzuschreiben.

  1. 01

    Projekt anlegen

    Ein Projekt ist ein VPL: eigener Endpunkt, eigener Key, eigene Nutzung. Benenn es nach dem, was es bedient.

  2. 02

    Anzahl der Instanzen festlegen

    Ein Regler entscheidet, wie viele Anfragen gleichzeitig laufen. Für eine Woche mit parallelen Agenten hoch, danach wieder runter. Das ist das ganze Kapazitätsmodell.

  3. 03

    Dein Tool darauf richten

    Base-URL und Key in Cline, ZooCode, VS Code BYOK oder ein beliebiges OpenAI-SDK. Sonst ändert sich nichts an deinem Setup.

beliebiger OpenAI-kompatibler Client
export OPENAI_BASE_URL=https://api.solheim.ai/v1
export OPENAI_API_KEY=slh_live_9f3c…

# über deine Instanzzahl hinaus werden Aufrufe eingereiht.
# kein 429, keine Zusatzkosten.

03 / Souveränität

In der EU gehostet, auf jeder Ebene.

Souveränität ist eine Architektur, kein Häkchen.

  1. 01

    Infrastruktur

    GPUs bei EU-eigenen Anbietern in EU-Rechenzentren. Kein US-Hyperscaler im Serving-Pfad — also kein CLOUD-Act-Risiko, das du in deinen AVV schreiben müsstest.

  2. 02

    Modelle

    Offene Gewichte unter permissiven Lizenzen, pro Instanz fixiert und von uns betrieben. Deine Prompts sind keine Trainingsdaten — weder unsere noch die von irgendwem sonst.

  3. 03

    Routing

    Anfragen verlassen die Region nicht, und diese Seite lädt kein Byte von einem fremden Origin — kein US-CDN, kein Analytics, keine Schriften, die nach Hause telefonieren.

Die Bibliothek

  • 01

    Qwen3.6-35B-A3B

    qwen3.6-35b-a3b

    128k Kontext
    Apache 2.0

    Der Standard für die tägliche Arbeit: Diffs, Tests, Refactorings und Agenten mit Tool-Calling. Ein Mixture-of-Experts-Modell: 35 Mrd. Parameter insgesamt, drei Milliarden davon aktiv pro Token — ein Preis-Leistungs-Verhältnis, das seinesgleichen sucht.

  • 02

    Qwen3.8-27B

    qwen3.8-27b

    128k Kontext
    Apache 2.0

    Der Schritt nach oben: die neueste Ergänzung der Qwen-Familie, ein kompaktes Dense-Modell mit deutlichen Gewinnen in Coding, Facharbeit, Recherche und langlaufenden Agenten-Aufgaben.

  • 03

    DeepSeek V4 Flash

    deepseek-v4-flash-0731

    256k Kontext
    MIT

    Open-Weight-Leistung nahe am Spitzenfeld, langer Kontext und Reasoning über lange Abschnitte, auf eigens für dich reservierter Rechenleistung.

  • +

    Modell anfragen

    offene Gewichte · permissive Lizenz

    Was am häufigsten gewünscht wird, kommt als Nächstes · eine E-Mail, wenn wir es betreiben.

04 / Preise

Zwei Regler: wie viele, wie viel Kontext.

Instanzen × Kontextfenster × ein fester Monatssatz. Weiterhin keine Tokens, keine Stufen, keine Übernutzung — auf dieser Rechnung kann dich nichts überraschen.

1
Context window
64k
Modell
eins pro Projekt
Über deine Anzahl hinaus
wird eingereiht, nie 429
Übernutzung
gibt es nicht

15,00 € /Monat · 1 × 64k × 15,00 €

Alle Preise netto, zzgl. gesetzlicher USt. Für Geschäftskunden mit USt-IdNr. innerhalb der EU gilt das Reverse-Charge-Verfahren.

In dieser Größe starten

Über zehn oder über 128k

Dediziert & Enterprise

Eine dedizierte GPU oder eine MIG-Partition davon — keine Nachbarn auf derselben Karte, kein Gedränge mit fremden Agenten. Ein 256k-Fenster gehört ebenfalls hierher: Es braucht das Vierfache an Cache der größten geteilten Größe und bekommt deshalb eine eigene Karte statt einer Warteschlange. Privates Networking, ein unterschriebener AVV und Rechnung statt Kreditkarte. Bepreist nach der Hardware, die du brauchst — nicht pro Anfrage.

Sprich uns an:

Kontakt aufnehmen

05 / Publikum

Für wen das ist.

Gleiches Produkt, gleiche Regler, gleiche Rechnung.

  1. 01

    Teams, die Coding-Agenten betreiben

    Du lebst in Cline, ZooCode oder VS Code und stößt fast jede Woche ans Limit. Drei Instanzen sind ein Agent, ein Editor und eine Testschleife gleichzeitig — so lange der Tag dauert.

  2. 02

    Gründer, die ein Inferenz-Backend brauchen

    Dein Produkt braucht ein privates LLM dahinter, mit einer Rechnung, die gleich bleibt, egal wie der Traffic schwankt. Richte dein Backend auf denselben Endpunkt und dimensioniere es genauso.

Das ist ein Produkt, nicht zwei. Was sich zwischen diesen beiden ändert, ist nur, was du auf den Endpunkt richtest — nicht der Preis, nicht die API, nicht die Maschine.

06 / Beiträge

Blog

Alle Posts

Ein Festpreis.
Ein Zuhause in der EU.

Ein Endpunkt, deine eigenen Keys und eine Rechnung, die sich nicht bewegt, egal wie viel du nutzt. Vom ersten Tag an in der EU gehostet.

In der EU gespeichert · gelöscht, sobald du es sagst.