Zum Inhalt
CaprilyticsInsights · Beitrag
A-01Kapitel 02 von 15Themenfeld 03 Das Gehirn~6 Min Lesezeit10. September 2026← B-01A-02 folgt am 24. September 2026
Werkstatt · Themenfeld 03 Das Gehirn

Womit unser Agent denkt

Wir nennen unser Modell, die Alternativen und die Zahlen – weil ein Assistent, dem man vertrauen soll, keine Blackbox sein darf.

Feinmechanische Werkstatt, Theodolit auf der Holzbank, Messuhren, Werkzeugtafel
Reihe A

Werkstatt

Wie es gebaut ist

AI generated

Themenfeld 03

Das Gehirn

Womit der Agent denkt – offengelegt.

Sie lesen A-01 4 Kapitel im Feld Alle im Feld →

Die meisten Anbieter verraten ihr Sprachmodell nicht – oder behaupten einfach, das «beste» zu nutzen. Wir legen offen, welches Modell wir einsetzen, gegen welche Alternativen wir es gemessen haben und welche Zahlen zur Entscheidung führten.

In Kürze
  • Unsere Wahl: ein offenes Modell, selbst in der Schweiz betrieben – Frontier-Treffsicherheit zu fairem Preis.
  • Entscheidend sind Treffsicherheit, Verlässlichkeit und Kontrolle, nicht «das grösste».
  • Kein Blindwechsel: ein neues Modell kommt erst rein, wenn es unseren Benchmark besteht.
Belegt durch

Benchmark – 23 Fälle, 4 Sprachen
Preisdaten – täglich aktualisiert
Stand – Juni 2026

Die Wahl

Unsere Wahl

Unser IT-Support-Assistent läuft auf Qwen3.5-35B-A3B, einem offenen Modell (Apache-2.0-Lizenz), das wir selbst auf Schweizer Infrastruktur betreiben, statt es als Blackbox aus einer fremden Cloud zu beziehen. Wir kontrollieren das Modell, seine Konfiguration und den Ort der Verarbeitung.

Warum nicht das grösste Frontier-Modell von OpenAI oder Anthropic? Weil unsere Entscheidung auf Dingen beruht, die für einen Support-Assistenten zählen – und «am teuersten» keines davon ist.

Das Verfahren

Worauf es ankam – und wie wir gemessen haben

Wir haben einen wiederholbaren Benchmark auf unseren echten Support-Aufgaben gebaut, nicht auf generischen Leaderboards: für jedes Modell dieselben Fälle, vier Achsen.

  1. Werkzeug-Treffsicherheit – 23 Fälle in Deutsch, Französisch, Italienisch und Englisch: wählt das Modell die richtige Aktion mit gültigen Parametern, in der Sprache des Nutzers?
  2. Antwortqualität – bewertet durch ein unabhängiges, starkes Schiedsrichter-Modell (GPT-5.4).
  3. Verlässlichkeit – Anteil leerer oder fehlerhafter Antworten.
  4. Kosten (CHF pro 1 Mio. Tokens, Stand Juni 2026).
Werkzeug-Treffsicherheit von zwölf Modellen A-01 · WERKSTATT Zwölf Modelle. Ein Prüfstand. 95 % WERKZEUG-TREFFSICHERHEIT · EIGENER BENCHMARK · JUNI 2026 · n=23

Notizen zu diesem Abschnitt

Der Autor
Markus Bättig

AI generated

Markus Bättig
Gründer · Caprilytics AG

Werkzeug-Treffsicherheit

95 %

Qwen3.5-35B-A3B · gleichauf mit Claude Opus
Begriff · Routing

Wählt das Modell die richtige Aktion mit gültigen Parametern – in der Sprache des Nutzers?

Das Verfahren · dieser Beitrag
Vier Sprachen

Deutsch, Französisch, Italienisch, Englisch – 23 Fälle je Durchlauf.

Direct-Messung Juni 2026
Die Zahlen

Die Ergebnisse – die Zahlen, die zur Wahl führten

→ Tabelle seitlich wischen

Die Ergebnisse – die Zahlen, die zur Wahl führten
ModellAnbieterRoutingQualität /10AntwortzeitCHF/1M (In / Out)
GPT-5.4-miniOpenAI100 %9.51.0 s0.60 / 3.57
GPT-5.4-nanoOpenAI100 %9.21.1 s0.16 / 0.99
GPT-5.4OpenAI97 %9.81.4 s1.99 / 11.91
Grok-4.1-fastxAI97 %9.42.5 s0.16 / 0.40
Claude OpusAnthropic95 %9.22.4 s3.97 / 19.85
Qwen3.5-35B-A3B → unsere Wahloffen, self-hosted (CH)95 %8.1¹1.1 s1.00 / 5.00
Qwen3.5-122BInfomaniak94 %9.50.7 s0.40 / 4.00
Ministral-14BMistral94 %7.90.6 s0.11 / 0.34
DeepSeek-chatDeepSeek88 %9.31.8 s0.22 / 0.33
Claude Sonnet 4.6Anthropic88 %8.32.8 s2.38 / 11.91
Claude Haiku 4.5Anthropic86 %9.01.9 s0.79 / 3.97
Apertus-70BSwiss AI33 %6.93.9 s0.88 / 3.13

¹ Gedrückt durch einen Schwachpunkt bei Anfragen ohne Suchtreffer: Unser Modell sucht dann erneut, statt «nichts gefunden» zu melden. Die 8.1 sind dabei die mildere von zwei Messungen – ein Kontroll-Lauf, der genau diese Fälle streng bewertet, ergab 7.3. Wir nennen beide Zahlen, statt nur die bessere. Das Verhalten verbessern wir gezielt: Transparenz vor Schönrechnen.

Direct-Messung gegen die rohe Modell-Schnittstelle, Juni 2026: 23 Routing-Fälle in Deutsch, Französisch, Italienisch und Englisch, ein Durchlauf je Modell, Qualität 1–10 bewertet durch GPT-5.4. Die Tabelle zeigt eine Auswahl aus dem gemessenen Feld. Kapitel 03 misst auf einem anderen, härteren Fall-Satz – die Werte dort sind darum nicht mit dieser Tabelle vergleichbar.

Antwortzeit = Median (p50) der Werkzeug-Entscheidung, gemessen in unserem Aufbau über unseren eigenen Proxy (Juni 2026) – bei fremden Modellen also inklusive Netzwerkweg, keine reine Modellgeschwindigkeit. Volle Support-Antworten dauern einige Sekunden mehr.

Treffsicherheit gegen Preis WERKZEUG-TREFFSICHERHEIT IN PROZENT · AUSGABEPREIS IN CHF JE MIO. TOKEN, LOGARITHMISCH 85 %90 %95 %100 %BRUCH0.3131020GPT-5.4-miniGPT-5.4-nanoGPT-5.4Grok-4.1OpusQwen3.5-35BQwen3.5-122BMinistralDeepSeekSonnet 4.6Haiku 4.5Apertus-70B 33 %UNSERE WAHL A-01 · WERKSTATT · FASSUNG 08.2026 QUELLE · EIGENER BENCHMARK V3 · JUNI 2026 · n=23
Der Befund

Was die Zahlen sagen

  • Werkzeug-Treffsicherheit – die wichtigste Achse für einen Assistenten, der echte Aktionen ausführt: Unser Modell liegt mit 95 % auf Frontier-Niveau, gleichauf mit Claude Opus, knapp hinter der GPT-5.4-Familie (97–100 %). Und das in vier Sprachen.
  • Verlässlichkeit: null leere oder fehlerhafte Antworten über alle Testläufe hinweg. Genau hier sahen wir bei einigen anderen, auch grösseren Modellen Aussetzer – der häufigste Grund für Frust im echten Betrieb.
  • Geschwindigkeit: volle Support-Antworten in median rund 2.4 Sekunden (90 % unter 2.7 s); reine Werkzeug-Entscheidungen in etwa einer Sekunde. Schnell genug, dass sich ein Gespräch natürlich anfühlt.
  • Antwortqualität: Die Spitzenmodelle (GPT-5.4: 9.8) und das grössere Qwen3.5-122B (9.5) formulieren etwas stärker. Für korrekte, belegte Support-Antworten reicht unser Niveau klar. Eine Schwäche kennen wir und nennen sie offen: Bei Anfragen, zu denen die Suche nichts findet, sucht unser Modell eher erneut, statt sofort «nichts gefunden» zu melden. Daran arbeiten wir gezielt. Für Literaturpreise gäbe es ohnehin Stärkere.
  • Kosten: Mit 1 / 5 CHF pro Mio. Tokens liegt unser Modell weit unter den Premium-Modellen (Opus 3.97 / 19.85, Sonnet 2.38 / 11.91, GPT-5.4 1.99 / 11.91) – wir behaupten aber nicht, das billigste zu sein. Es gibt günstigere Modelle; sie erfüllen unsere übrigen Kriterien nicht so gut.

Notizen zu diesem Abschnitt

Aussetzer

0

leere oder fehlerhafte Antworten über alle Testläufe
Zur Qualitätsnote

Schwachpunkt bei Anfragen ohne Suchtreffer – 8.1 mild gemessen, 7.3 streng.

Der Befund · dieser Beitrag
Das versteckte Risiko

Stabilität ist keine Glückssache, sondern eingebaut.

Es ändert sich nur, wenn wir es ändern.

A-01 · Das Risiko

Das Risiko

Das grösste versteckte Risiko: wenn sich das Modell unter Ihnen ändert

Wer einen Assistenten direkt an eine fremde Cloud-API hängt, hat ein Problem, das man erst merkt, wenn es zu spät ist: Der Anbieter aktualisiert oder pensioniert das Modell – und Ihre sorgfältig abgestimmten Abläufe brechen über Nacht. Eine neue Modellversion wählt plötzlich ein anderes Werkzeug, formuliert anders, hält sich nicht mehr an dieselben Vorgaben. Sie haben weder Kontrolle über das Wann noch über das Ob.

Wir haben das strukturell ausgeschlossen:

  • Ein fixiertes, selbst betriebenes Modell. Es ändert sich nur, wenn wir es ändern – nicht, wenn ein Anbieter einen Stichtag setzt.
  • Speziell auf Botster abgestimmt. Das Modell ist auf unsere Werkzeuge, unsere Sprache und unsere Abläufe ausgerichtet – nicht ein generisches Modell, dem man hofft, dass es passt.
  • Testfälle, die genau unsere Workflows prüfen. Unser Benchmark besteht aus Fällen, die exakt auf Botster zugeschnitten sind. Bei einem fremden Modell, das sich jederzeit ändern kann, lässt sich diese Verlässlichkeit schlicht nicht garantieren.
  • Kein Blindwechsel. Sollte je ein neues Modell besser passen, wechseln wir erst, nachdem es gegen unseren Botster-Benchmark angetreten ist und bestanden hat – nie auf Verdacht, nie unter Zeitdruck eines Anbieters.

Für Sie heisst das: Ihr Assistent verhält sich morgen so wie heute. Stabilität ist keine Glückssache, sondern eingebaut.

Der Nutzen

Warum diese Wahl – und was Sie davon haben

Wir haben nicht das billigste und nicht das prestigeträchtigste Modell gewählt, sondern das mit der besten Kombination für unseren Zweck:

  • Datensouveränität. Es läuft auf Infrastruktur, die wir in der Schweiz kontrollieren – nicht in einer fremden Cloud, deren Bedingungen sich ändern können. Für Spitäler, Behörden und Schweizer KMU ist das die Voraussetzung, überhaupt mitzumachen.
  • Verlässlichkeit durch Kontrolle. Weil wir das Modell selbst betreiben, kontrollieren wir die Konfiguration und haben die Aussetzer-Probleme strukturell beseitigt – keine API-Blackbox.
  • Spitzen-Treffsicherheit zu fairem Preis. Frontier-nahes Routing, deutlich unter den Premium-Tarifen.
Der Ausblick

Und es bleibt offen

Die Modell-Landschaft ändert sich monatlich – unsere Preisdaten aktualisieren wir automatisch täglich, den Benchmark wiederholen wir bei jeder relevanten Modelländerung. Sobald ein Modell für unsere Aufgaben und unsere Anforderungen an Souveränität messbar besser passt, wechseln wir. Datengetrieben, nicht marketinggetrieben. Die Methodik legen wir auf Anfrage offen.

Notizen zu diesem Abschnitt

Preis je Mio. Token

1 / 5
CHF

gegen Opus 3.97 / 19.85
Begriff · Blindwechsel

Ein Modelltausch ohne vorherigen Lauf gegen den eigenen Benchmark. Findet bei uns nicht statt.

Das Risiko · dieser Beitrag
Weiter · A-02 · Themenfeld 03 Das Gehirn

Wie vergleicht man 27 Modelle fair – und welche Eigenschaft entscheidet, die auf keinem Leaderboard steht?

A-02 · 27 Modelle, ein Massstab · erscheint 24. September 2026
Wo Sie sind

caprilytics.com › Insights › Werkstatt › A-01

Markus Bättig

AI generated

Der Autor
Markus Bättig
Gründer · Caprilytics AG
Fragen oder Interesse an einer Demo?Kontakt →
Weitergeben LinkedIn E-Mail
Kein Kapitel verpassen

Jeden Donnerstag ein neuer Beitrag, vom Fundament bis zum fertigen Assistenten. Tragen Sie sich ein – wir melden uns nur, wenn ein neues Kapitel erscheint.

Schweizer Hosting · Double-Opt-in · jederzeit abbestellbar · keine Weitergabe