X Mind Solutions logoX Mind Solutions
Blog

Sprachmodelle im Test: Die Befunde von Grok 4.5 High und Fabel 5 einordnen

Wir bewerten die mit Grok 4.5 High und Fabel 5 in einer älteren Projektversion gewonnenen Befunde und betrachten dabei die Aussagekraft der Zahlen sowie die Grenzen des Vergleichs.

Künstliche Intelligenz · 2026-07-09 · 3 Min. Lesezeit

Sprachmodelle im Test: Die Befunde von Grok 4.5 High und Fabel 5 einordnen

In unserem Test mit einer älteren Projektversion lieferte Fabel 5 insgesamt 68 Befunde, während das über Cursor eingesetzte Grok 4.5 High auf 100 kam. Dieser Unterschied allein bedeutet keine höhere Genauigkeit. Für einen aussagekräftigen Modellvergleich müssen die Gültigkeit der Befunde, mögliche Dopplungen und ihre Umsetzbarkeit im Entwicklungsprozess geprüft werden.

  • 9. Juli 2026

Um den Nutzen eines neuen Sprachmodells für die Softwareentwicklung zu verstehen, untersuchen wir, wie es in einem realen Projekt arbeitet. Bei X Mind Solutions verwenden wir für den Test jedes neuen Sprachmodells eine ältere Version eines Projekts. So schaffen wir eine Grundlage, um zu untersuchen, was die Modelle im selben Projektkontext erkennen. Die Anzahl der Befunde allein darf jedoch nicht als Maß für die Modellqualität oder die Genauigkeit der Prüfung verstanden werden.

In diesem Test hatte Fabel 5 in der älteren Projektversion 68 Befunde geliefert. Grok 4.5 High, das wir über Cursor eingesetzt haben, lieferte 100 Befunde. Dieser zahlenmäßige Unterschied bietet einen Ausgangspunkt für einen detaillierten Vergleich der beiden Ergebnisse. Daraus lässt sich jedoch nicht ableiten, dass Grok 4.5 High genauer arbeitet oder mehr tatsächliche Fehler erkennt. Die Art jedes einzelnen aufgeführten Befunds muss gesondert bewertet werden.

Beim Vergleich sollte zunächst geklärt werden, ob die beiden Modelle dieselben Themen unterschiedlich darstellen. Ein Modell kann ein einzelnes Problem in mehrere Punkte aufteilen, während das andere diese unter einer gemeinsamen Überschrift zusammenfasst. Ebenso darf ein Verbesserungsvorschlag nicht derselben Kategorie zugeordnet werden wie ein überprüfbarer Softwarefehler. Für eine aussagekräftige Prüfung müssen die Befunde daher thematisch einander zugeordnet, Dopplungen ausgesondert und die Belege für jede Aussage im Projekt überprüft werden.

Die Verwendung derselben älteren Projektversion schafft zwar eine hilfreiche gemeinsame Grundlage, reicht allein aber nicht für einen fairen Modellvergleich aus. Auch die Anweisungen, der dem Modell bereitgestellte Kontext und der Umfang der Prüfung können die Bewertung beeinflussen. Die Befundzahlen dieses Tests belegen nicht, dass all diese Bedingungen identisch waren. Statt aus der vorliegenden Beobachtung eine allgemeine Leistungsrangfolge abzuleiten, sollte sie daher als Anlass verstanden werden, die Unterschiede zwischen den beiden Ergebnissen in diesem Projekt näher zu untersuchen.

Für Unternehmen ist nicht entscheidend, welches Modell die längere Liste erstellt, sondern welches Ergebnis dem Entwicklungsteam mehr Nutzen bietet. Im Vordergrund sollten Befunde stehen, die sich überprüfen lassen, deren Auswirkungen nachvollziehbar sind und aus denen sich eine umsetzbare Korrektur ableiten lässt. Um den Unterschied zwischen Grok 4.5 High und Fabel 5 zu verstehen, muss der zahlenmäßige Vergleich deshalb durch diese qualitative Prüfung ergänzt werden. Bislang liegen zwei unterschiedliche Befundzahlen vor, aber kein verifiziertes Ergebnis, das eine Überlegenheit belegen würde.

Häufige Fragen

Wie testet X Mind Solutions neue Sprachmodelle?
Bei X Mind Solutions testen wir neue Sprachmodelle anhand einer älteren Version eines Projekts. Damit schaffen wir eine gemeinsame Grundlage, auf der wir die von den Modellen im Projektkontext erzeugten Befunde untersuchen können.
Hat Grok 4.5 High in diesem Test besser abgeschnitten als Fabel 5?
Grok 4.5 High lieferte 100 Befunde, Fabel 5 dagegen 68. Allein anhand dieser Zahlen lässt sich jedoch keine Leistungsrangfolge erstellen. Die Richtigkeit, die Eigenständigkeit und die Umsetzbarkeit der Befunde müssen gesondert bewertet werden.
Ist jeder von einem Modell erzeugte Befund ein Softwarefehler?
Nicht jeder Befund sollte als bestätigter Softwarefehler gelten. Einzelne Punkte können Verbesserungsvorschläge enthalten oder dasselbe Problem wiederholt behandeln. Jeder Befund muss im Projektkontext überprüft werden.
Welche Testbedingungen sollten beim Modellvergleich berücksichtigt werden?
Neben der Projektversion sind auch die Anweisungen, der bereitgestellte Kontext und der Umfang der Prüfung zu berücksichtigen. Solange nicht bestätigt ist, dass diese Bedingungen identisch waren, sollte aus den Befundzahlen keine allgemeine Aussage zur Leistung abgeleitet werden.

Kaynak: Orijinal kaynak

X MIND WEEKLY

Was ist diese Woche in der KI passiert?

Möchten Sie aktuelle KI-News für Ihr Unternehmen? KI-Themen weltweit und in der Türkei, Praxisbeispiele aus KobiGPT und sofort umsetzbare Automatisierungsideen: 1 E-Mail pro Woche, ~3 Minuten Lesezeit, kein Spam.

Nach der Anmeldung klicken Sie bitte auf den Bestätigungslink in Ihrer E-Mail. Sie können sich jederzeit abmelden. Frühere Ausgaben lesen →