Machine-Learning-Engineer — Evaluation
Sie sorgen dafür, dass ein Lauf reproduzierbar ist und eine Zahl bedeutet, was sie behauptet.
Warum °nrth
KI-Agenten gehen gerade dort in Produktion, wo Ergebnisse verantwortet werden müssen — in Steuerberatungen, Ingenieurbüros, Kanzleien. Ob sie dort tragen, misst bisher niemand ernsthaft.
Wir bauen den Maßstab dafür: Fälle aus dem Arbeitsalltag, Prüflisten aus objektiven Kriterien und zwei Kennzahlen, die nie miteinander verrechnet werden. Das Unternehmen ist klein, die Entscheidungswege sind kurz, und was Sie bauen, geht in Wochen in Betrieb, nicht in Quartalen.
Ihre Aufgaben
- Läufe gegen verschiedene Modelle und Agenten aufsetzen, protokollieren und wiederholbar machen.
- Die automatische Vorbewertung entwickeln, die dem menschlichen Prüfer zuarbeitet, ohne ihn zu ersetzen.
- Streuung und Unsicherheit ausweisen, statt Einzelwerte als Wahrheit auszugeben.
- Trainingsmaterial aus Befunden ableiten: Chain-of-Thought-Verläufe, Bewertungsraster, Agentenumgebungen.
Was Sie mitbringen
- Erfahrung mit der Bewertung von Sprachmodellen oder Agenten, gern mit eigenen Benchmarks.
- Vertrautheit mit Reinforcement Learning gegen Rubriken und mit Werkzeugaufrufen über API oder MCP.
- Ein gesundes Misstrauen gegenüber jeder Zahl, die zu gut aussieht.
Wir besetzen unabhängig von Herkunft, Geschlecht, Alter, Behinderung, Religion oder sexueller Identität. Wenn Sie glauben, die Anforderungen nur zum Teil zu erfüllen, bewerben Sie sich trotzdem — wir lesen jede Zuschrift.
