ON
← Torna al feed
Kog sta andando più in profondità per spremere più inferenza fuori di GPU
United States💻 Tecnologia9 gg fa

Kog sta andando più in profondità per spremere più inferenza fuori di GPU

La startup francese Kog sta lavorando per ottimizzare le GPU standard dei data center per un'inferenza più veloce del modello linguistico di grandi dimensioni (LLM) attraverso miglioramenti software piuttosto che affidarsi a hardware specializzato. La società ha dimostrato un'anteprima tecnologica che mostra 3.000 token al secondo di prestazioni utilizzando un modello di 2 miliardi di parametri chiamato Laneformer 2B, che ora è open source. Kog mira a fornire un'inferenza AI più veloce sull'hardware esistente, rivolgendosi alle aziende che richiedono AI per compiti professionali e agli sviluppatori che creano giochi o app tramite prompt. La startup evidenzia che le GPU più recenti hanno una maggiore larghezza di banda di memoria che può essere sfruttata per prestazioni migliori. Kog affronta sfide nello scalare questo approccio a LLM più grandi, ma il CEO Gaël Delalleau ritiene che la tecnologia possa avere successo nonostante lo scetticismo.

La startup francese Kog sta spingendo i confini delle prestazioni dell'intelligenza artificiale con l'obiettivo di migliorare significativamente la velocità dell'inferenza del grande modello linguistico (LLM) utilizzando unità di elaborazione grafica convenzionali (GPU). Gli ultimi sforzi della società si concentrano sull'ottimizzazione delle GPU esistenti del data center, come AMD MI300X e Nvidia H200, per fornire un'elaborazione AI più veloce ed efficiente senza richiedere hardware specializzato.

Kog ha attirato l'attenzione all'inizio di quest'anno dopo aver mostrato un prototipo che ha dimostrato una decodifica a singola richiesta estremamente veloce su GPU standard di livello enterprise. La dimostrazione ha utilizzato un piccolo modello costruito su misura chiamato Laneformer 2B, che ha raggiunto un tasso di token al secondo di 3.000. Tuttavia, la scalabilità di questi risultati a LLM più grandi rimane una sfida. Nonostante ciò, l'amministratore delegato di Kog, Gaël Delalleau, ritiene che i principi sottostanti possano essere applicati a modelli più complessi, sbloccando potenzialmente miglioramenti di prestazioni molto maggiori.

Questi includono professionisti che si affidano a strumenti di IA per flussi di lavoro critici, così come sviluppatori che creano contenuti interattivi come videogiochi e applicazioni mobili. Kog mira a fornire una soluzione che consenta a questi utenti di generare risultati più rapidamente, aumentando così la produttività e la redditività. Delalleau ha sottolineato che mentre l'attuale mercato per l'inferenza AI è ancora in evoluzione, c'è una chiara necessità di migliori prestazioni.

Di conseguenza, Kog ha dato la priorità allo sviluppo di metodi per accelerare la formazione e la distribuzione di modelli più grandi, in linea con le richieste osservate sul campo. L'approccio di Kog è diverso da quello di altre aziende che lavorano su problemi simili. A differenza di ZML, un'altra startup francese che offre software hardware-agnostico per inferenze veloci su diverse architetture di chip, Kog si concentra più profondamente sulle ottimizzazioni specifiche per GPU. Delalleau ha confrontato la strategia della startup con quella del laboratorio Hazy Research dell'Università di Stanford, che enfatizza anche la massimizzazione delle prestazioni della GPU attraverso analisi dettagliate e innovazione software.

Delalleau porta una prospettiva unica al tavolo, plasmata dal suo background accademico e professionale. Dopo aver studiato fisica dello stato solido all'École Polytechnique francese, in seguito ha lavorato nella sicurezza informatica offensiva, comunemente chiamata hacking a cappello bianco. Questa esperienza gli ha instillato una mentalità incentrata sulla comprensione dei sistemi fondamentali e sul loro sfruttamento creativo per raggiungere obiettivi specifici. La sua carriera nella sicurezza informatica, inclusa la partecipazione al concorso DEFCON Capture The Flag (CTF) come quattro volte finalista, gli ha insegnato a fare ingegneria inversa di tecnologie a basso livello, fino al linguaggio di assemblaggio e al codice binario.

Questo set di competenze ha influenzato il modo in cui Kog si avvicina alla sua ricerca e sviluppo, enfatizzando l'esplorazione meticolosa di ogni nuova architettura GPU per estrarre le massime prestazioni. Nonostante il potenziale promettente della tecnologia di Kog, il percorso da percorrere è impegnativo. L'ottimizzazione delle prestazioni per ogni nuova generazione di GPU richiede test e raffinamenti approfonditi, che spesso richiedono diverse settimane o addirittura mesi per dispositivo. Questo processo è sia laborioso che altamente tecnico, riflettendo la profondità dell'esperienza necessaria per spingere i limiti dell'hardware convenzionale. Mentre Kog continua a perfezionare le sue tecniche, le implicazioni più ampie per l'industria dell'IA rimangono da vedere.

Se avrà successo, la startup potrebbe offrire un'alternativa praticabile ai chip AI specializzati che attualmente dominano il mercato, fornendo alle aziende un mezzo più flessibile ed economico per migliorare le loro capacità di IA.

Vai alle fonti primarie (6)

Le fonti ufficiali su cui si basa la copertura. Leggile direttamente per aggirare il framing.

1 servizi

TechCrunch logoTechCrunchIndipendenteCentroFattualità 95Obiettività 889 gg fa
Kog sta andando più in profondità per spremere più inferenza fuori di GPU

La startup francese Kog sta lavorando per ottimizzare le GPU standard dei data center per un'inferenza più veloce del modello linguistico di grandi dimensioni (LLM) attraverso miglioramenti software piuttosto che affidarsi a hardware specializzato. La società ha dimostrato un'anteprima tecnologica che mostra 3.000 token al secondo di prestazioni utilizzando un modello di 2 miliardi di parametri chiamato Laneformer 2B, che ora è open source. Kog mira a fornire un'inferenza AI più veloce sull'hardware esistente, rivolgendosi alle aziende che richiedono AI per compiti professionali e agli sviluppatori che creano giochi o app tramite prompt. La startup evidenzia che le GPU più recenti hanno una maggiore larghezza di banda di memoria che può essere sfruttata per prestazioni migliori. Kog affronta sfide nello scalare questo approccio a LLM più grandi, ma il CEO Gaël Delalleau ritiene che la tecnologia possa avere successo nonostante lo scetticismo.

Lettura del bias (Centro): L'articolo discute i progressi nell'ottimizzazione dell'inferenza AI utilizzando GPU standard e non coinvolge figure politiche, politiche o questioni controverse.

Perché fattualità (95): The article accurately reports on Kog's approach to optimizing GPU usage for AI inference, citing specific GPUs like AMD MI300X and Nvidia H200. It references CEO Gaël Delalleau's statements and mentions the potential market applications, aligning with the primary source document's focus on Kog's st

Perché obiettività (88): The article presents Kog's value proposition and market opportunities in a balanced manner, though it highlights potential benefits for users and businesses without explicitly addressing potential limitations or criticisms. The tone remains informative rather than overtly promotional.

Come l’ha coperta ogni schieramento

Lo stesso evento, raggruppato per l’orientamento politico delle testate che ne parlano.

Come l’ha coperta ogni schieramento

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Nel mondo

Lo stesso evento come riportato in altri paesi.

Nel mondo

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Verifica delle affermazioni

Le principali affermazioni fattuali e quante fonti le sostengono o le contestano.

Verifica delle affermazioni

Sostieni notizie indipendenti e consapevoli del bias e sblocca il polso social, il voto della comunità e tutte le altre funzioni per i sostenitori.

Diventa sostenitore

Manteniamo le notizie oneste.

ObjectiveNews è finanziato dai lettori e senza pubblicità: ti mostriamo il bias invece di nasconderlo. Sostieni il giornalismo indipendente per 4 €/mese.

Diventa sostenitore

Storie correlate