ON
← Torna al feed
Il CTO di GitHub si scusa con gli sviluppatori dopo una delle più grandi interruzioni
India🏛️ PoliticaCentroieri

Il CTO di GitHub si scusa con gli sviluppatori dopo una delle più grandi interruzioni

Il CTO di GitHub, Vlad Fedorov, si è scusato pubblicamente per una grave interruzione che è durata 7 ore e 47 minuti il 17 agosto. L'interruzione è stata causata da una combinazione di guasti tecnici tra cui una politica di autoscaling che monitorava la metrica sbagliata, la saturazione del bilanciatore di carico e un bug di riprova latente in Visual Studio Code. Questi problemi hanno portato a un significativo degrado delle prestazioni, con tassi di errore che raggiungono fino al 50% per alcuni servizi. L'incidente evidenzia le sfide crescenti legate alla rapida espansione di GitHub, poiché l'utilizzo è aumentato da 1,4 miliardi a 2,9 miliardi di commit mensili. L'azienda ha delineato i piani per migliorare la resilienza del sistema, compresi i cambiamenti ai meccanismi di riprova e alle strategie di scalabilità. L'interruzione si è verificata solo poche settimane dopo un altro incidente che ha colpito il servizio Actions di GitHub, sollevando preoccupazioni tra concorrenti come Cursor e CloudBees.

Il Chief Technology Officer di GitHub, Vlad Fedorov, ha rilasciato una pubblica scusa agli sviluppatori in seguito a una delle più gravi interruzioni della piattaforma, che è durata sette ore e 47 minuti il 17 agosto. L'interruzione ha interrotto i servizi principali tra cui autenticazione, Azioni, API, richieste di pull, problemi e Copilot, lasciando molti utenti incapaci di accedere agli strumenti essenziali per i loro flussi di lavoro. Secondo un post sul blog pubblicato il 20 agosto, Fedorov ha riconosciuto che il problema derivava da una sfida di scalabilità fondamentale piuttosto che da un errore umano.

Ha dichiarato che nessuno ha spinto codice difettoso o sistemi mal configurati, e il problema è sorto perché la piattaforma semplicemente è rimasta senza spazio per gestire livelli di traffico senza precedenti. La causa principale dell'interruzione è stata ricondotta a una politica di autoscaling che monitorava la metrica sbagliata. In particolare, la politica si è concentrata sul servizio host piuttosto che sul sidecar Istio, che ha raggiunto il suo limite di concurrenza. Ciò ha portato alla saturazione dei bilanciatori di carico all'interno del data center centrale degli Stati Uniti di GitHub. Un bug di retry latente in Visual Studio Code ha ulteriormente esacerbato la situazione amplificando il traffico a un singolo endpoint interno di circa 10 volte.

Come risultato, il servizio Copilot Token è rimasto offline significativamente più a lungo rispetto ad altri servizi. Gli ingegneri hanno infine disabilitato i riprovini del gateway e hanno iniziato a restituire errori HTTP 403 per le richieste di token Copilot in arrivo. Inoltre, gli attacchi di scraping sugli endpoint di carico di codice hanno complicato il processo di recupero. Al culmine della interruzione, la pagina di stato di GitHub ha registrato tassi di errore vicini al 20% per il traffico web e API e circa il 50% per i download di archivio e repository grezzi. La maggior parte dei servizi ha ripreso il normale funzionamento entro il 1636 UTC, con Actions recuperato entro il 1803 UTC e il servizio Copilot Token finalmente tornato online a 2102 UTC.

Per soddisfare questa domanda, l'azienda ha implementato più di 3 milioni di core CPU e 120 petabyte di storage ad alta velocità, spingendo i limiti dei data center esistenti.

In risposta, GitHub ha delineato diverse correzioni pianificate, tra cui l'implementazione di limiti di riprova coerenti, budget di riprova e timeout variabili nelle interazioni di servizio.

Durante questo periodo, Cursor ha lanciato una prima versione beta del suo prodotto Origin Code Hosting, capitalizzando sull'indisponibilità di GitHub.

1 servizi

Times of India logoTimes of IndiaIndipendenteCentroFattualità 95Obiettività 90ieri
Il CTO di GitHub si scusa con gli sviluppatori dopo una delle più grandi interruzioni

Il CTO di GitHub, Vlad Fedorov, si è scusato pubblicamente per una grave interruzione che è durata 7 ore e 47 minuti il 17 agosto. L'interruzione è stata causata da una combinazione di guasti tecnici tra cui una politica di autoscaling che monitorava la metrica sbagliata, la saturazione del bilanciatore di carico e un bug di riprova latente in Visual Studio Code. Questi problemi hanno portato a un significativo degrado delle prestazioni, con tassi di errore che raggiungono fino al 50% per alcuni servizi. L'incidente evidenzia le sfide crescenti legate alla rapida espansione di GitHub, poiché l'utilizzo è aumentato da 1,4 miliardi a 2,9 miliardi di commit mensili. L'azienda ha delineato i piani per migliorare la resilienza del sistema, compresi i cambiamenti ai meccanismi di riprova e alle strategie di scalabilità. L'interruzione si è verificata solo poche settimane dopo un altro incidente che ha colpito il servizio Actions di GitHub, sollevando preoccupazioni tra concorrenti come Cursor e CloudBees.

Lettura del bias (Centro): L'articolo presenta un resoconto fattuale di un fallimento tecnico senza un'aperta inquadratura ideologica. Mentre discute le implicazioni della crescita di GitHub e menziona le reazioni dei concorrenti, questi elementi sono presentati in modo neutrale senza enfasi partigiana.

Perché fattualità (95): The article provides detailed technical explanations of the outage including the role of autoscaling policies, Istio sidecars, and the impact of Visual Studio Code's retry bug. These details align with the general consensus found in other sources covering the same event. The timeline of recovery and

Perché obiettività (90): The article maintains a largely neutral tone throughout, presenting facts and technical details without overt bias or emotional language. It includes direct quotes from the official blog post and avoids taking sides or making subjective judgments about the incident.

Come l’ha coperta ogni schieramento

Lo stesso evento, raggruppato per l’orientamento politico delle testate che ne parlano.

Come l’ha coperta ogni schieramento

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Nel mondo

Lo stesso evento come riportato in altri paesi.

Nel mondo

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Verifica delle affermazioni

Le principali affermazioni fattuali e quante fonti le sostengono o le contestano.

Verifica delle affermazioni

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Manteniamo le notizie oneste.

ObjectiveNews è finanziato dai lettori e senza pubblicità: ti mostriamo il bias invece di nasconderlo. Sostieni il giornalismo indipendente per 4 €/mese.

Diventa sostenitore

Storie correlate