ON
← Retour au fil
Kog va plus loin pour presser plus d'inférence des GPU
United States💻 Technologieil y a 9 j

Kog va plus loin pour presser plus d'inférence des GPU

La start-up française Kog s'emploie à optimiser les GPU standard des centres de données pour une inférence plus rapide du modèle de langage volumineux (LLM) grâce à des améliorations logicielles plutôt que de s'appuyer sur un matériel spécialisé. La société a démontré un aperçu technologique montrant 3000 jetons par seconde de performance en utilisant un modèle de 2 milliards de paramètres appelé Laneformer 2B, qui est maintenant open source. Kog vise à fournir une inférence AI plus rapide sur le matériel existant, ciblant les entreprises qui ont besoin d'IA pour des tâches professionnelles et les développeurs créant des jeux ou des applications via des invites. La start-up souligne que les GPU plus récents ont une bande passante de mémoire accrue qui peut être exploitée pour améliorer les performances. Kog fait face à des défis dans l'extension de cette approche aux LLM plus grands, mais le PDG Gaël Delalleau estime que la technologie peut réussir malgré le scepticisme.

La start-up française Kog repousse les limites de la performance de l'intelligence artificielle en visant à améliorer considérablement la vitesse de l'inférence du grand modèle linguistique (LLM) à l'aide d'unités de traitement graphique (GPU) conventionnelles. Les derniers efforts de la société se concentrent sur l'optimisation des GPU existants des centres de données, tels que l'AMD MI300X et Nvidia H200, pour fournir un traitement AI plus rapide et plus efficace sans nécessiter de matériel spécialisé.

Kog a attiré l'attention au début de l'année après avoir présenté un prototype qui démontrait un décodeur de requête unique extrêmement rapide sur des GPU standard de niveau entreprise. La démonstration a utilisé un petit modèle sur mesure appelé Laneformer 2B, qui a atteint un taux de jeton par seconde de 3000. Cependant, l'échelle de ces résultats à de plus grands LLM reste un défi. Malgré cela, le PDG de Kog, Gaël Delalleau, estime que les principes sous-jacents peuvent être appliqués à des modèles plus complexes, débloquant potentiellement des améliorations de performances beaucoup plus importantes. La startup a déjà commencé à s'engager avec des clients potentiels qui font face à des goulots d'étranglement en raison de la lenteur des vitesses d'inférence.

Il s'agit notamment des professionnels qui s'appuient sur des outils d'IA pour des flux de travail critiques, ainsi que des développeurs créant du contenu interactif comme les jeux vidéo et les applications mobiles. Kog vise à fournir une solution qui permet à ces utilisateurs de générer des résultats plus rapidement, augmentant ainsi la productivité et la rentabilité.

En conséquence, Kog a donné la priorité au développement de méthodes pour accélérer la formation et le déploiement de modèles plus grands, en s'alignant sur les demandes observées sur le terrain. L'approche de Kog diffère des autres entreprises travaillant sur des problèmes similaires. Contrairement à ZML, une autre startup française qui offre un logiciel indépendant du matériel pour une inférence rapide sur différentes architectures de puces, Kog se concentre plus profondément sur les optimisations spécifiques aux GPU.

Après avoir étudié la physique des solides à l'École Polytechnique de France, il a ensuite travaillé dans la cybersécurité offensive, communément appelée hacking de chapeau blanc. Cette expérience lui a inculqué un état d'esprit centré sur la compréhension des systèmes fondamentaux et leur exploitation créative pour atteindre des objectifs spécifiques.

Cet ensemble de compétences a influencé la façon dont Kog aborde sa recherche et son développement, mettant l'accent sur l'exploration méticuleuse de chaque nouvelle architecture GPU pour extraire une performance maximale. Malgré le potentiel prometteur de la technologie de Kog, la voie à suivre est difficile. L'optimisation des performances pour chaque nouvelle génération de GPU nécessite des tests et un raffinement approfondis, prenant souvent plusieurs semaines voire plusieurs mois par appareil. Ce processus est à la fois laborieux et hautement technique, reflétant la profondeur de l'expertise requise pour repousser les limites du matériel conventionnel.

Si elle réussit, la start-up pourrait offrir une alternative viable aux puces d'IA spécialisées qui dominent actuellement le marché, offrant aux entreprises un moyen plus flexible et rentable d'améliorer leurs capacités d'IA.

Aller aux sources primaires (6)

Les sources officielles sur lesquelles repose la couverture. Lisez-les directement pour contourner le cadrage.

1 articles

TechCrunch logoTechCrunchIndépendantCentreFactualité 95Objectivité 88il y a 9 j
Kog va plus loin pour presser plus d'inférence des GPU

La start-up française Kog s'emploie à optimiser les GPU standard des centres de données pour une inférence plus rapide du modèle de langage volumineux (LLM) grâce à des améliorations logicielles plutôt que de s'appuyer sur un matériel spécialisé. La société a démontré un aperçu technologique montrant 3000 jetons par seconde de performance en utilisant un modèle de 2 milliards de paramètres appelé Laneformer 2B, qui est maintenant open source. Kog vise à fournir une inférence AI plus rapide sur le matériel existant, ciblant les entreprises qui ont besoin d'IA pour des tâches professionnelles et les développeurs créant des jeux ou des applications via des invites. La start-up souligne que les GPU plus récents ont une bande passante de mémoire accrue qui peut être exploitée pour améliorer les performances. Kog fait face à des défis dans l'extension de cette approche aux LLM plus grands, mais le PDG Gaël Delalleau estime que la technologie peut réussir malgré le scepticisme.

Lecture du biais (Centre): L'article traite des avancées dans l'optimisation de l'inférence de l'IA en utilisant des GPU standard et n'implique pas de personnalités politiques, de politiques ou de questions controversées.

Pourquoi factualité (95): The article accurately reports on Kog's approach to optimizing GPU usage for AI inference, citing specific GPUs like AMD MI300X and Nvidia H200. It references CEO Gaël Delalleau's statements and mentions the potential market applications, aligning with the primary source document's focus on Kog's st

Pourquoi objectivité (88): The article presents Kog's value proposition and market opportunities in a balanced manner, though it highlights potential benefits for users and businesses without explicitly addressing potential limitations or criticisms. The tone remains informative rather than overtly promotional.

Comment chaque camp l’a couvert

Le même événement, regroupé selon l’orientation politique des médias qui le couvrent.

Comment chaque camp l’a couvert

Soutenez une information indépendante et consciente des biais, et débloquez le pouls social, le vote communautaire et toutes les autres fonctions pour les soutiens.

Devenir soutien

Couverture dans le monde

Le même événement tel que rapporté dans d’autres pays.

Couverture dans le monde

Soutenez une information indépendante et consciente des biais, et débloquez le pouls social, le vote communautaire et toutes les autres fonctions pour les soutiens.

Devenir soutien

Vérification des affirmations

Les principales affirmations factuelles et combien de sources les confirment ou les contestent.

Vérification des affirmations

Soutenez une information indépendante et consciente des biais, et débloquez le pouls social, le vote communautaire et toutes les autres fonctions pour les soutiens.

Devenir soutien

Gardons l’information honnête.

ObjectiveNews est financé par ses lecteurs et sans publicité : nous vous montrons le biais au lieu de le cacher. Soutenez un journalisme indépendant pour 4 €/mois.

Devenir soutien

Sujets liés