Die Menschmaschine muß eingearbeitet werden 0 ▲ Die wunderbare Welt von Isotopp 14 hours ago · 10 min read1994 words · History · hide · 0 comments Der Real-SWE-Benchmark wirft moderne Coding Agents auf private Codebasen realer Firmen und gibt ihnen Aufgaben, die dort tatsächlich angefallen sind. Das Ergebnis sieht im ersten Moment schlecht aus: Der beste getestete Agent löst 38,8 Prozent, GPT-6 Astra mit Codex 33,8 Prozent und GPT-5.6 Sol mit Codex 16,2 Prozent. Genau deshalb halte ich das Ergebnis für unerwartet gut. Die Zahlen sind erstaunlich hoch. Der Benchmark setzt einen neuen Mitarbeiter ohne Einarbeitung vor eine proprietäre Enterprise-Codebase, gibt ihm ein Ticket mit median 1.742 Zeichen und erwartet eine fertige Änderung. Die Referenzlösung berührt median elf Dateien. Es geht um Abrechnung, Steuern, Migrationen, Identitäten und verteilte Datenspeicher. Das sind Aufgaben, bei denen eine plausible Lösung nicht genügt. Sie muß zu den Geschäftsregeln und Arbeitsweisen genau dieser Firma passen. Wenn ein Uni-Abgänger oder Postdoc bei seinem ersten Tag in einer Firma aus einem solchen Ticket in einem Versuch eine korrekte… No comments yet. Log in to reply on the Fediverse. Comments will appear here.