Produkt
Fachliches Urteil lässt sich nicht abfragen. Es zeigt sich erst, wenn jemand einen Fall bearbeitet, bei dem mehr als eine Antwort plausibel klingt und trotzdem nur eine richtig ist.
Unsere Produkte sind die Werkzeuge, mit denen sich dieses Urteil festhalten lässt: Fälle, Prüflisten, Umgebungen — und die Auswertungen, die daraus entstehen.
Was in den Feldern steht, wechselt mit dem Fachgebiet. Die Werkzeuge nicht.
Messen
Einzelbefund
Ihr Agent bearbeitet Fälle aus einem bestehenden Katalog. Sie bekommen beide Kennzahlen, die Bewertung jedes einzelnen Kriteriums und die vollständige Antwort daneben — nachvollziehbar bis zur Fundstelle.
Fachbenchmark
Ein eigener Katalog für Ihr Gebiet. Fälle aus dem Arbeitsalltag, vollständig erfunden, mit Referenzlösung und einer Rubrik aus zehn bis fünfzehn objektiven Kriterien. Zwei bis drei davon sind kritisch: Wer sie verfehlt, liefert kein verwertbares Ergebnis.
Fehleranalyse
Jedes Kriterium ist einer Bewertungsdimension zugeordnet. Dadurch lässt sich auswerten, wo ein Agent scheitert — bei der Erfassung des Sachverhalts, bei den Fundstellen, beim Rechnen oder beim Endergebnis. Das ist die Grundlage für alles, was danach kommt.
Laufende Messung
Jeder neue Versionsstand läuft gegen denselben Katalog, dieselbe Rubrik, dieselben kritischen Kriterien. Nur der Agent ändert sich. Damit wird Fortschritt belegt statt behauptet — und sichtbar, wo keiner stattgefunden hat.
Verbessern
Supervised Fine-Tuning (SFT)
Hochwertige Prompt-Antwort-Paare und Chain-of-Thought-Verläufe — sie bringen Modellen bei, wie sie sich über komplexe Aufgaben hinweg verhalten sollen.
Reinforcement Learning + Rubriken
Von Fachleuten entworfene Prompts mit Bewertungsrastern für Schlussfolgern und Codeerzeugung — sie machen aus subjektivem Urteil ein skalierbares Belohnungssignal.
Agentenumgebungen (API / MCP)
Maßgeschneiderte Umgebungen über APIs, Werkzeuge und Dienste hinweg — für Training und Bewertung von Agenten in echten Arbeitsabläufen.
Jedes Stück lässt sich einzeln bestellen. Der übliche Einstieg ist ein Einzelbefund an einem Fall aus Ihrem Fachgebiet.
Agenten prüfen lassen