Intelligenz
70 %AA Intelligence Index v4.3 auf seiner festen Originalskala. Der breite Fähigkeitsindex bildet die Basis unseres geometrischen Gesamtscores.
Eine offene Formel über unabhängig gemessene Daten — keine bezahlten Platzierungen, ein redaktionelles Profil für anspruchsvolle Arbeit. Wie sich Gewichtung und Regeln zu einer Zahl verdichten, steht hier vollständig offen.
KI Weekly v4.0 kombiniert AA Intelligence mit Coding und Agenten, berechnet aus Artificial-Analysis-Benchmarks. Preis und Tempo bleiben separate Orientierungshilfen. Die Zusatzgewichte für Coding und Agenten setzen bewusst einen Arbeitsfokus.
AA Intelligence Index v4.3 auf seiner festen Originalskala. Der breite Fähigkeitsindex bildet die Basis unseres geometrischen Gesamtscores.
Coding (aus Terminal-Bench 4.0 und SciCode), berechnet von KI Weekly aus Artificial-Analysis-Benchmarks. Die Zusatzgewichtung betont Programmierarbeit.
Agenten (aus AA-Briefcase, GDPval-AA und AutomationBench), berechnet von KI Weekly aus Artificial-Analysis-Benchmarks.
Coding = 100 × (⅔ × Terminal-Bench 4.0 + ⅓ × SciCode).
Agenten = 100 × (15 × Briefcase-Norm + 10 × GDPval-AA normiert + 5 × AutomationBench) / 30. Briefcase-Norm = begrenzt((Briefcase-Elo − 500) / 2000, 0, 1).
Artificial Analysis veröffentlicht für neue Modelle keinen Coding oder Agentic Index mehr. KI Weekly berechnet beide Werte deshalb aus den veröffentlichten Benchmarks.
Score=Intelligenz0,70× Coding0,15× Agenten0,15
Score=57,60,70× 62,030,15× 67,040,15≈59,6
v4.0 · 29.09.2026: Coding aus Terminal-Bench 4.0 und SciCode; Agenten aus AA-Briefcase, GDPval-AA und AutomationBench. Die Scoregewichte bleiben 70/15/15.
Acht Grundsätze, nach denen jeder Score entsteht — bewusst so gebaut, dass sie ohne Statistik-Studium nachvollziehbar sind.
AA Intelligence v4.3 und die beiden von KI Weekly berechneten Werte stehen auf einer Skala von 0 bis 100. Neue Modelle verändern vorhandene Gesamtscores nicht.
AA Intelligence in der unterstützten Version sowie beide abgeleiteten Werte müssen vorliegen. Fehlende Bausteine erzeugen keinen Score und keinen Bonus durch Gewichtsverschiebung. Null ist ein gültiger Messwert.
Coding und Agenten sind bereits im Intelligence Index enthalten. Ihre Zusatzgewichte betonen Programmier- und Agentenarbeit bewusst. Das sind keine unabhängigen Messdimensionen.
Score = Intelligenz^0,70 × Coding^0,15 × Agenten^0,15. Schwächen lassen sich weniger leicht durch eine einzelne Stärke ausgleichen als im arithmetischen Mittel. Die Gewichte sind redaktionell gesetzt.
Kosten pro Index-Aufgabe, Tokenpreise und Performance stehen neben dem Fähigkeitsranking. Sie werden weder vermischt noch in den Gesamtscore eingerechnet. Fehlendes Tempo schließt ein Modell nicht aus.
Die Free-API liefert keinen Estimated-Status. Auch drei vorhandene Indizes sind kein Nachweis vollständiger Einzelmessungen. Die Rangliste ist deshalb ein Orientierungsangebot ohne Signifikanz- oder Vollständigkeitsversprechen.
API-Version, Indexversion, Scoreversion und Abrufzeit werden gespeichert. Der Abrufzeitpunkt ist kein Messdatum. Neue Indexversionen benötigen eine erneute Prüfung der Scoremethodik.
Fähigkeit, Preis und Tempo eines Datenpunkts stammen aus derselben AA-Konfiguration. Die beste Scorevariante vertritt die Modellfamilie. Die beiden abgeleiteten Werte nutzen Benchmarks derselben Modell-ID.
Das gewichtete geometrische Mittel aus AA Intelligence und zwei von KI Weekly berechneten Teilwerten: Intelligenz (70 %), Coding (15 %) und Agenten (15 %). Coding und Agenten überlappen mit Intelligence und werden bewusst zusätzlich betont. AA Intelligence in Version 4.3 und beide abgeleiteten Werte sind Pflicht. Preis und Tempo verändern den Gesamtscore nicht. Die Gewichte sind eine redaktionelle Entscheidung, keine objektive Erfolgswahrscheinlichkeit.
Alle Benchmark-, Preis- und Tempo-Daten stammen von Artificial Analysis — einem unabhängigen Institut, das Modelle standardisiert und kontinuierlich vermisst. Anbieter können dort weder für Ergebnisse noch für Listungen bezahlen. Die Score-Berechnung, Gewichtung und Aufbereitung darüber ist von KI Weekly.
Täglich. Ein automatischer Abgleich holt jede Nacht die neuesten Messwerte, berechnet alle Scores neu und aktualisiert sämtliche Seiten — ohne manuelles Zutun. Neue Modelle tauchen in der Regel innerhalb von 24 bis 48 Stunden nach Release auf.
Ein Score verlangt AA Intelligence v4.3 sowie Coding aus Terminal-Bench 4.0 und SciCode und Agenten aus AA-Briefcase, GDPval-AA und AutomationBench. Fehlt ein Baustein, bleibt der Gesamtscore offen. Fehlendes Tempo oder fehlende Preise sind kein Ausschlussgrund. Der Free-Zugang liefert keinen Messstatus; unbekannt bedeutet nicht vollständig gemessen.
Ein Mischpreis aus Input- und Output-Token im Verhältnis 3:1 — das entspricht typischer Nutzung, bei der Prompts länger sind als Antworten. Ein Modell mit 1 $ Input- und 4 $ Output-Preis hat also einen Blended-Preis von 1,75 $ pro 1 Mio. Token.
Das komplette Ranking mit Leaderboard, Charts und allen 479 Modellen.