Hive Bench
Wie Coding-Modelle an echten CI-Fehlern abschneiden.
Kein synthetischer Benchmark. Jede Zeile ist ein Modell in der Factory-Lane auf Produktions-Repositories, deren CI Hive betreibt — rote Checks und Tickets — mit einem Fix, den ein frisches CI-Gate auf genau diesem Commit geprüft hat. Gemessen mit demselben Instrument, das die Betreiber nutzen.
Ein datierter Schnappschuss, aus der laufenden Messung erneuert. Raten tragen ihre Nenner; Zeilen unter der Stichprobengrenze werden gezeigt, nicht gerankt.
Methode
Echte Arbeit, durch ein Gate geprüft
Ein Run ist ein echter roter Check oder ein Ticket in einem Produktions-Repository. Ein Fix gilt als gehalten, wenn ein frisches CI-Gate auf genau diesem Commit bestanden hat. Kein Modell benotet hier seine eigene Antwort.
Methode
Geprüfte Fixes sind der Nenner
Die Rate „Fix gehalten“ bezieht sich auf Fixes, die ein Gate tatsächlich beurteilt hat — grün oder rot. Ein gepushter, nie beurteilter Fix zählt als Abdeckung neben der Rate, nie als Fehlschlag darin.
Methode
Intervalle statt Punktschätzungen
Jede Rate wird mit einem 95-%-Wilson-Intervall gezeichnet und nach der Untergrenze gerankt. Ein Modell mit drei perfekten Runs steht unter einem mit sechzig guten.
- Quelle
- Produktions-CI-Fehler
- Urteil
- Ein frisches Gate auf genau dem Commit
- Ranking
- Untergrenze der Rate „Fix gehalten“
Methode
Was eine Zeile bedeutet — und was nicht.
Drei Messungen werden einmal, auf dem Control Plane, zusammengeführt und unverändert veröffentlicht. Die Regeln unten setzt das Instrument durch; es sind keine redaktionellen Entscheidungen.
Echte Arbeit, durch ein Gate geprüft
Ein Run ist ein echter roter Check oder ein Ticket in einem Produktions-Repository. Ein Fix gilt als gehalten, wenn ein frisches CI-Gate auf genau diesem Commit bestanden hat. Kein Modell benotet hier seine eigene Antwort.
Geprüfte Fixes sind der Nenner
Die Rate „Fix gehalten“ bezieht sich auf Fixes, die ein Gate tatsächlich beurteilt hat — grün oder rot. Ein gepushter, nie beurteilter Fix zählt als Abdeckung neben der Rate, nie als Fehlschlag darin.
Intervalle statt Punktschätzungen
Jede Rate wird mit einem 95-%-Wilson-Intervall gezeichnet und nach der Untergrenze gerankt. Ein Modell mit drei perfekten Runs steht unter einem mit sechzig guten.
Eine Stichprobengrenze vor dem Ranking
Eine Zeile wird nur mit mindestens dreißig geprüften Fixes und mindestens der Hälfte ihrer Pushes beurteilt gerankt. Zeilen darunter stehen unter der Tabelle mit der Grenze, die sie verfehlt haben.
Vor dem Traffic gesiebt, nach Lieferung gerankt
Der Offline-Screen spielt einen eingefrorenen Satz historischer Fehler nach und entscheidet nur, ob ein Modell unbeaufsichtigt laufen darf: nie editiert, wenn Nichtstun richtig war, und das Protokoll stets abgeschlossen. Die Live-Lieferung rankt, was besteht.
Leitern, und wo ein Modell darauf saß
Die Flotte fährt jede Stufe als Leiter: ein Primärmodell und Fallbacks. Ein erschöpftes Primärmodell reicht seinen Traffic an die nächste Sprosse weiter, sodass ein Fallback den Großteil einer Stufe tragen kann. Der Primäranteil sagt, wie viel der Arbeit eines Modells von der obersten Sprosse kam — ein niedriger Anteil heißt: gemessen an Fehlern, die eine Sprosse darüber schon verloren hatte.
Aktuelle Aufstellung
Die Leiter jeder Stufe, wie konfiguriert.
Aus der Konfiguration der Flotte zum Zeitpunkt des Schnappschusses gelesen. Der Quota-Zustand wird nicht veröffentlicht: eine erschöpfte Sprosse ist beim Lesen eine Woche alt.
Der erste Schnappschuss wurde noch nicht exportiert.
Lieferung
Fix gehalten, auf geprüften Fixes.
Gerankt nach der Untergrenze der Rate „Fix gehalten“. Abdeckung ist geprüfte Fixes durch Pushes. Zeit bis grün ist der Median vom Start des Runs bis zum ersten grünen Gate auf seinem Commit.
Noch kein Schnappschuss. Die Tabelle erscheint hier nach dem ersten Export; die Methode oben ändert sich nicht.
Offline-Screen
Unbeaufsichtigt lauffähig — ein Gate, keine Note.
Jedes Modell spielt denselben eingefrorenen Satz echter historischer Fehler durch das Produktions-Harness nach. „Zugelassen“ heißt: nie den Scope verletzt, auf jedem Fall das Protokoll abgeschlossen, nie editiert, wenn Nichtstun richtig war.
Noch kein Schnappschuss. Die Tabelle erscheint hier nach dem ersten Export; die Methode oben ändert sich nicht.
Was diese Seite nicht zeigt
Bewusst weggelassen.
Jede Auslassung ist eine Regel, kein Versehen.
- Kosten
- Keine Währung, keine Token, kein Kostenindex irgendeiner Art. Die Modellabrechnung läuft zwischen Ihnen und Ihrem Anbieter.
- Anbieter
- Modelle werden nach Familie benannt. Ein über mehrere Routen erreichtes Modell behält die Route aus der Aufstellung; Routen werden nie summiert.
- Merge-Rate
- Hive hält keinen Merge-Zustand von Pull Requests. „Fix gehalten“ ist die stärkste Landung, die es prüfen kann.
- Flottenübergreifendes Pooling
- Nur Factory-Runs. Interaktive Sessions sind eine andere Flotte mit anderen Nennern und werden nicht eingemischt.
- Anbieter-Benchmarks
- Kein veröffentlichter Index eines Anbieters fließt in eine Zeile ein. Lieferung an echter Arbeit ist das einzige Ranking-Signal.
- Reasoning-Aufwand
- Es läuft der Standardaufwand jedes Anbieters; er wird weder gesteuert noch erfasst, sodass jeder Modellvergleich diesen Störfaktor trägt.
Weiter
Die Lane sehen, aus der diese Zahlen kommen.
Selbstheilende CI
Vom roten Check zum geprüften Fix
Wie aus einem geeigneten roten Check eine begrenzte Coding-Aufgabe und ein Kandidat wird, den Ihr Branch-Gate prüft.
Den Reparaturkreis entdeckenAgenten-Plattform
Workstation-, Cloud- und Factory-Lanes
Ein Bedienplatz für Coding-Agenten, wo immer sie laufen, mit Branch, PR und CI neben jeder Session.
Agenten-Lanes entdeckenPrivate Beta
Bringen Sie ein Repository mit. Sehen Sie das ganze System arbeiten.
Starten Sie auf Ihrem eigenen Runner, lassen Sie Ihre bestehende CI daneben weiterlaufen und sehen Sie, wie Hive aus dem nächsten geeigneten roten Check einen prüfbaren Fix macht.