ON
← Volver al feed
Kog va más profundo para exprimir más inferencia de GPUs
United States💻 Tecnologíahace 9 d

Kog va más profundo para exprimir más inferencia de GPUs

La startup francesa Kog está trabajando para optimizar las GPU estándar de centros de datos para una inferencia más rápida del modelo de lenguaje grande (LLM) a través de mejoras de software en lugar de confiar en hardware especializado. La compañía demostró una vista previa tecnológica que muestra 3,000 tokens por segundo de rendimiento utilizando un modelo de 2 mil millones de parámetros llamado Laneformer 2B, que ahora es de código abierto. Kog tiene como objetivo proporcionar una inferencia más rápida de IA en el hardware existente, dirigiéndose a las empresas que requieren IA para tareas profesionales y a los desarrolladores que crean juegos o aplicaciones a través de indicaciones. La startup destaca que las GPU más nuevas tienen un mayor ancho de banda de memoria que se puede aprovechar para mejorar el rendimiento. Kog se enfrenta a desafíos al escalar este enfoque a LLMs más grandes, pero el CEO Gaël Delalleau cree que la tecnología puede tener éxito a pesar del escepticismo.

La startup francesa Kog está empujando los límites del rendimiento de la inteligencia artificial con el objetivo de mejorar significativamente la velocidad de la inferencia del modelo de lenguaje grande (LLM) utilizando unidades de procesamiento gráfico (GPU) convencionales. Los últimos esfuerzos de la compañía se centran en optimizar las GPUs de centros de datos existentes, como AMD MI300X y Nvidia H200, para ofrecer un procesamiento de IA más rápido y eficiente sin requerir hardware especializado. Esto se produce en medio de la creciente presión de la industria para reducir la latencia y el costo en las aplicaciones de IA, particularmente en sectores que dependen de respuestas en tiempo real.

Kog ganó atención a principios de este año después de mostrar un prototipo que demostró una decodificación de una sola solicitud extremadamente rápida en GPUs estándar de nivel empresarial. La demostración utilizó un modelo pequeño personalizado llamado Laneformer 2B, que logró una tasa de token por segundo de 3,000. Sin embargo, escalar estos resultados a LLM más grandes sigue siendo un desafío. A pesar de esto, el CEO de Kog, Gaël Delalleau, cree que los principios subyacentes se pueden aplicar a modelos más complejos, lo que podría desbloquear mejoras de rendimiento mucho mayores. La startup ya ha comenzado a involucrarse con clientes potenciales que enfrentan cuellos de botella debido a las lentas velocidades de inferencia.

Estos incluyen profesionales que confían en herramientas de IA para flujos de trabajo críticos, así como desarrolladores que crean contenido interactivo como videojuegos y aplicaciones móviles. Kog tiene como objetivo proporcionar una solución que permita a estos usuarios generar resultados más rápidamente, aumentando así la productividad y la rentabilidad. Delalleau enfatizó que, si bien el mercado actual de inferencia de IA aún está evolucionando, existe una clara necesidad de un mejor rendimiento. Señaló que muchas empresas dudan en invertir en modelos más pequeños de ajuste fino, lo que limita su capacidad para aprovechar las funciones avanzadas de IA.

Como resultado, Kog ha priorizado el desarrollo de métodos para acelerar la capacitación y el despliegue de modelos más grandes, alineándose con las demandas observadas en el campo. El enfoque de Kog difiere de otras compañías que trabajan en problemas similares. A diferencia de ZML, otra startup francesa que ofrece software independiente del hardware para inferencia rápida a través de diferentes arquitecturas de chips, Kog se enfoca más profundamente en optimizaciones específicas de GPU. Delalleau comparó la estrategia de la startup con la del laboratorio de Hazy Research en la Universidad de Stanford, que también enfatiza la maximización del rendimiento de la GPU a través de análisis detallado e innovación de software.

Delalleau trae una perspectiva única a la mesa, formada por su formación académica y profesional. Habiendo estudiado física de estado sólido en la École Polytechnique de Francia, más tarde trabajó en ciberseguridad ofensiva, comúnmente conocida como hacking de sombrero blanco. Esta experiencia le inculcó una mentalidad centrada en la comprensión de sistemas fundamentales y su aprovechamiento creativo para lograr objetivos específicos. Su carrera en ciberseguridad, incluida la participación en la competencia Capture The Flag (CTF) de DEFCON como cuatro veces finalista, le enseñó a realizar ingeniería inversa en tecnologías a bajo nivel, hasta el lenguaje de ensamblaje y el código binario.

Este conjunto de habilidades ha influido en la forma en que Kog aborda su investigación y desarrollo, enfatizando la exploración meticulosa de cada nueva arquitectura de GPU para extraer el máximo rendimiento. A pesar del prometedor potencial de la tecnología de Kog, el camino por delante es desafiante. La optimización del rendimiento para cada nueva generación de GPU requiere pruebas y refinamientos extensos, que a menudo toman varias semanas o incluso meses por dispositivo. Este proceso es a la vez intensivo en mano de obra y altamente técnico, lo que refleja la profundidad de la experiencia requerida para superar los límites del hardware convencional.

Si tiene éxito, la puesta en marcha podría ofrecer una alternativa viable a los chips de IA especializados que actualmente dominan el mercado, proporcionando a las empresas un medio más flexible y rentable para mejorar sus capacidades de IA.

Ir a las fuentes primarias (6)

Las fuentes oficiales en las que se basa la cobertura. Léelas directamente para evitar el encuadre.

1 informaciones

TechCrunch logoTechCrunchIndependienteCentroVeracidad 95Objetividad 88hace 9 d
Kog va más profundo para exprimir más inferencia de GPUs

La startup francesa Kog está trabajando para optimizar las GPU estándar de centros de datos para una inferencia más rápida del modelo de lenguaje grande (LLM) a través de mejoras de software en lugar de confiar en hardware especializado. La compañía demostró una vista previa tecnológica que muestra 3,000 tokens por segundo de rendimiento utilizando un modelo de 2 mil millones de parámetros llamado Laneformer 2B, que ahora es de código abierto. Kog tiene como objetivo proporcionar una inferencia más rápida de IA en el hardware existente, dirigiéndose a las empresas que requieren IA para tareas profesionales y a los desarrolladores que crean juegos o aplicaciones a través de indicaciones. La startup destaca que las GPU más nuevas tienen un mayor ancho de banda de memoria que se puede aprovechar para mejorar el rendimiento. Kog se enfrenta a desafíos al escalar este enfoque a LLMs más grandes, pero el CEO Gaël Delalleau cree que la tecnología puede tener éxito a pesar del escepticismo.

Lectura del sesgo (Centro): El artículo analiza los avances en la optimización de inferencia de IA utilizando GPU estándar y no involucra figuras políticas, políticas o temas polémicos. Se centra en la innovación tecnológica y las aplicaciones de la industria sin tomar una postura o mostrar sesgo hacia ninguna perspectiva política.

Por qué veracidad (95): The article accurately reports on Kog's approach to optimizing GPU usage for AI inference, citing specific GPUs like AMD MI300X and Nvidia H200. It references CEO Gaël Delalleau's statements and mentions the potential market applications, aligning with the primary source document's focus on Kog's st

Por qué objetividad (88): The article presents Kog's value proposition and market opportunities in a balanced manner, though it highlights potential benefits for users and businesses without explicitly addressing potential limitations or criticisms. The tone remains informative rather than overtly promotional.

Cómo lo cubrió cada lado

El mismo suceso, agrupado por la inclinación política de los medios que lo cubren.

Cómo lo cubrió cada lado

Apoya noticias independientes y conscientes del sesgo y desbloquea el pulso social, el voto de la comunidad y todas las demás funciones para suscriptores.

Hazte suscriptor

Cobertura en el mundo

El mismo suceso según se informó en otros países.

Cobertura en el mundo

Apoya noticias independientes y conscientes del sesgo y desbloquea el pulso social, el voto de la comunidad y todas las demás funciones para suscriptores.

Hazte suscriptor

Verificación de afirmaciones

Las principales afirmaciones fácticas y cuántas fuentes las respaldan o las rebaten.

Verificación de afirmaciones

Apoya noticias independientes y conscientes del sesgo y desbloquea el pulso social, el voto de la comunidad y todas las demás funciones para suscriptores.

Hazte suscriptor

Mantengamos las noticias honestas.

ObjectiveNews se financia con los lectores y no tiene anuncios: te mostramos el sesgo en lugar de ocultarlo. Apoya el periodismo independiente por 4 €/mes.

Hazte suscriptor

Historias relacionadas