Dashboard
Ubersicht aller KI-Modell Test-Runs
Ziel der Test-Runs
Verschiedene KI-Modelle bekamen immer dieselbe Aufgabe: „suggest additional unit tests for our project“.
Die Vorschläge sollten anschließend umgesetzt werden. Ausgangsbranch war immer test/ai-base,
jedes Modell arbeitete auf einem eigenen Branch
(Branches auf GitHub).
Erste PHPUnit- und PHPFunctional-Tests existierten bereits, das Grundsetup war also schon vorhanden.
Modelle getestet
14
Branches bestanden
8/14
PHPUnit finalTop Score
100
Opus5Meiste Tests
83
Opus5
Modell-Score
Gesamtbewertung (niedriger = schlechter)
Finales Branch-Ergebnis
PHPUnit auf dem Branch
Test-Qualität (max. 18)
Unit-Test-Bewertung pro Modell
PHPUnit Korrektur-Effizienz
Runs: bestanden vs. fehlgeschlagen
PHPStan Korrektur-Effizienz
Runs: bestanden vs. fehlgeschlagen
Prompt-Verarbeitung (t/s)
hoeher = schneller
Text-Generierung (t/s)
hoeher = schneller
Alle Test-Runs
Legende:
Lokal gelaufen
Potenziell lokal (32 GB VRAM)
Cloud-only