ON
← Zurück zum Feed
GitHub CTO entschuldigt sich bei den Entwicklern nach einem der größten Ausfälle
India🏛️ PolitikMittegestern

GitHub CTO entschuldigt sich bei den Entwicklern nach einem der größten Ausfälle

Der CTO von GitHub, Vlad Fedorov, entschuldigte sich öffentlich für einen großen Ausfall, der am 17. August 7 Stunden und 47 Minuten dauerte. Der Ausfall wurde durch eine Kombination von technischen Fehlern verursacht, darunter eine Autoscaling-Richtlinie, die die falsche Metrik überwacht, die Sättigung des Lastbalancers und einen latenten Wiederholungsfehler im Visual Studio Code. Diese Probleme führten zu einer signifikanten Leistungsabnahme, wobei die Fehlerrate bei bestimmten Diensten bis zu 50% erreichte. Der Vorfall unterstreicht die wachsenden Herausforderungen im Zusammenhang mit der schnellen Expansion von GitHub, da die Nutzung von 1,4 Milliarden auf 2,9 Milliarden monatliche Commits gestiegen ist. Das Unternehmen skizzierte Pläne zur Verbesserung der Systemwiderstandsfähigkeit, einschließlich Änderungen an Wiederholungsmechanismen und Skalierungsstrategien.

Der Chief Technology Officer von GitHub, Vlad Fedorov, entschuldigte sich öffentlich bei den Entwicklern nach einem der schwersten Ausfälle der Plattform, der am 17. August sieben Stunden und 47 Minuten dauerte. Der Ausfall störte Kerndienste wie Authentifizierung, Aktionen, APIs, Pull-Requests, Probleme und Copilot, so dass viele Benutzer nicht auf essentielle Tools für ihre Workflows zugreifen konnten. Laut einem am 20. August veröffentlichten Blogbeitrag räumte Fedorov ein, dass das Problem eher auf eine grundlegende Skalierbarkeitsherausforderung als auf einen menschlichen Fehler zurückzuführen ist.

Er stellte fest, dass niemand fehlerhaften Code oder falsch konfigurierte Systeme verschoben hat, und das Problem entstand, weil die Plattform einfach keinen Platz mehr hatte, um beispiellose Verkehrsniveaus zu bewältigen. Die Ursache des Ausfalls wurde auf eine Autoscaling-Richtlinie zurückgeführt, die die falsche Metrik überwachte. Insbesondere konzentrierte sich die Richtlinie auf den Host-Service und nicht auf den Istio-Sidecar, der seine Konkurrenzgrenze erreichte. Dies führte zu einer Sättigung der Lastbalancer innerhalb des GitHub Central US-Rechenzentrums.

Als Ergebnis blieb der Copilot Token Service deutlich länger als andere Dienste offline. Ingenieure deaktivierten schließlich Gateway-Wiederholungen und begannen, HTTP 403-Fehler für eingehende Copilot-Token-Anfragen zurückzugeben. Zusätzlich erschwerten Scraping-Angriffe auf Codeload-Endpunkte den Wiederherstellungsprozess. Auf dem Höhepunkt des Ausfalls verzeichnete GitHubs Statusseite Fehlerraten von nahezu 20% für Web- und API-Verkehr und etwa 50% für Archive und Raw-Repository-Downloads. Die meisten Dienste wiederaufnahmen den normalen Betrieb um 1636 UTC, wobei Actions bis 1803 UTC wiederhergestellt wurde und der Copilot Token Service schließlich um 2102 UTC wieder online kam.

Die verlängerte Ausfallzeit hatte spürbare Auswirkungen auf Entwickler, die versuchten, Code bereitzustellen oder zu verwalten, insbesondere während einer Periode erhöhter Aktivität auf der Plattform. Fedorov hob hervor, dass das schnelle Wachstum von GitHub zu einem wichtigen Faktor für seine Zuverlässigkeitsprobleme geworden ist.

Als Reaktion darauf skizzierte GitHub mehrere geplante Korrekturen, darunter die Implementierung konsistenter Wiederholungsgrenzen, Wiederholungsbudgets und variabler Timeouts für Service-Interaktionen. Es plant auch, CPU- und Speicheralarme mit niedrigerer Priorität zu überprüfen und eine neue Architektur einzuführen, die die Lesekapazität proportional zur Anzahl gleichzeitiger Leser skalieren soll. Diese Änderungen werden zunächst auf die größten Monorepositories abzielen. Der Zeitpunkt dieser Entwicklungen fällt mit einem anderen Vorfall zusammen, der GitHub Anfang August betraf, als am 6. August eine Störung des Actions-Dienstes auftrat.

Während dieser Zeit startete Cursor eine frühe Beta-Version seines Origin Code Hosting-Produkts und nutzte die Nichtverfügbarkeit von GitHub aus.

1 Berichte

Times of India logoTimes of IndiaUnabhängigMitteFaktentreue 95Objektivität 90gestern
GitHub CTO entschuldigt sich bei den Entwicklern nach einem der größten Ausfälle

Der CTO von GitHub, Vlad Fedorov, entschuldigte sich öffentlich für einen großen Ausfall, der am 17. August 7 Stunden und 47 Minuten dauerte. Der Ausfall wurde durch eine Kombination von technischen Fehlern verursacht, darunter eine Autoscaling-Richtlinie, die die falsche Metrik überwacht, die Sättigung des Lastbalancers und einen latenten Wiederholungsfehler im Visual Studio Code. Diese Probleme führten zu einer signifikanten Leistungsabnahme, wobei die Fehlerrate bei bestimmten Diensten bis zu 50% erreichte. Der Vorfall unterstreicht die wachsenden Herausforderungen im Zusammenhang mit der schnellen Expansion von GitHub, da die Nutzung von 1,4 Milliarden auf 2,9 Milliarden monatliche Commits gestiegen ist. Das Unternehmen skizzierte Pläne zur Verbesserung der Systemwiderstandsfähigkeit, einschließlich Änderungen an Wiederholungsmechanismen und Skalierungsstrategien.

Tendenz-Einschätzung (Mitte): Der Artikel präsentiert eine sachliche Darstellung eines technischen Fehlers ohne offensichtliche ideologische Rahmenbedingungen. Während er die Auswirkungen des Wachstums von GitHub diskutiert und die Reaktionen der Wettbewerber erwähnt, werden diese Elemente neutral ohne parteiische Betonung dargestellt.

Warum Faktentreue (95): The article provides detailed technical explanations of the outage including the role of autoscaling policies, Istio sidecars, and the impact of Visual Studio Code's retry bug. These details align with the general consensus found in other sources covering the same event. The timeline of recovery and

Warum Objektivität (90): The article maintains a largely neutral tone throughout, presenting facts and technical details without overt bias or emotional language. It includes direct quotes from the official blog post and avoids taking sides or making subjective judgments about the incident.

Wie jede Seite berichtete

Dasselbe Ereignis, gruppiert nach der politischen Ausrichtung der berichtenden Medien.

Wie jede Seite berichtete

Unterstütze unabhängige, biasbewusste Nachrichten und schalte den Social-Puls, das Community-Voting und alle weiteren Unterstützer-Funktionen frei.

Unterstützer werden

Weltweite Berichterstattung

Dasselbe Ereignis, wie es in anderen Ländern berichtet wurde.

Weltweite Berichterstattung

Unterstütze unabhängige, biasbewusste Nachrichten und schalte den Social-Puls, das Community-Voting und alle weiteren Unterstützer-Funktionen frei.

Unterstützer werden

Faktencheck

Zentrale faktische Aussagen und wie viele Quellen sie bestätigen bzw. bestreiten.

Faktencheck

Unterstütze unabhängige, biasbewusste Nachrichten und schalte den Social-Puls, das Community-Voting und alle weiteren Unterstützer-Funktionen frei.

Unterstützer werden

Halte die Nachrichten ehrlich.

ObjectiveNews ist leserfinanziert und werbefrei – wir zeigen dir den Bias, statt ihn zu verstecken. Unterstütze unabhängigen Journalismus für 4 €/Monat.

Unterstützer werden

Ähnliche Themen