La startup francesa Kog está empujando los límites del rendimiento de la inteligencia artificial con el objetivo de mejorar significativamente la velocidad de la inferencia del modelo de lenguaje grande (LLM) utilizando unidades de procesamiento gráfico (GPU) convencionales. Los últimos esfuerzos de la compañía se centran en optimizar las GPUs de centros de datos existentes, como AMD MI300X y Nvidia H200, para ofrecer un procesamiento de IA más rápido y eficiente sin requerir hardware especializado. Esto se produce en medio de la creciente presión de la industria para reducir la latencia y el costo en las aplicaciones de IA, particularmente en sectores que dependen de respuestas en tiempo real.
Kog ganó atención a principios de este año después de mostrar un prototipo que demostró una decodificación de una sola solicitud extremadamente rápida en GPUs estándar de nivel empresarial. La demostración utilizó un modelo pequeño personalizado llamado Laneformer 2B, que logró una tasa de token por segundo de 3,000. Sin embargo, escalar estos resultados a LLM más grandes sigue siendo un desafío. A pesar de esto, el CEO de Kog, Gaël Delalleau, cree que los principios subyacentes se pueden aplicar a modelos más complejos, lo que podría desbloquear mejoras de rendimiento mucho mayores. La startup ya ha comenzado a involucrarse con clientes potenciales que enfrentan cuellos de botella debido a las lentas velocidades de inferencia.
Estos incluyen profesionales que confían en herramientas de IA para flujos de trabajo críticos, así como desarrolladores que crean contenido interactivo como videojuegos y aplicaciones móviles. Kog tiene como objetivo proporcionar una solución que permita a estos usuarios generar resultados más rápidamente, aumentando así la productividad y la rentabilidad. Delalleau enfatizó que, si bien el mercado actual de inferencia de IA aún está evolucionando, existe una clara necesidad de un mejor rendimiento. Señaló que muchas empresas dudan en invertir en modelos más pequeños de ajuste fino, lo que limita su capacidad para aprovechar las funciones avanzadas de IA.
Como resultado, Kog ha priorizado el desarrollo de métodos para acelerar la capacitación y el despliegue de modelos más grandes, alineándose con las demandas observadas en el campo. El enfoque de Kog difiere de otras compañías que trabajan en problemas similares. A diferencia de ZML, otra startup francesa que ofrece software independiente del hardware para inferencia rápida a través de diferentes arquitecturas de chips, Kog se enfoca más profundamente en optimizaciones específicas de GPU. Delalleau comparó la estrategia de la startup con la del laboratorio de Hazy Research en la Universidad de Stanford, que también enfatiza la maximización del rendimiento de la GPU a través de análisis detallado e innovación de software.
Delalleau trae una perspectiva única a la mesa, formada por su formación académica y profesional. Habiendo estudiado física de estado sólido en la École Polytechnique de Francia, más tarde trabajó en ciberseguridad ofensiva, comúnmente conocida como hacking de sombrero blanco. Esta experiencia le inculcó una mentalidad centrada en la comprensión de sistemas fundamentales y su aprovechamiento creativo para lograr objetivos específicos. Su carrera en ciberseguridad, incluida la participación en la competencia Capture The Flag (CTF) de DEFCON como cuatro veces finalista, le enseñó a realizar ingeniería inversa en tecnologías a bajo nivel, hasta el lenguaje de ensamblaje y el código binario.
Este conjunto de habilidades ha influido en la forma en que Kog aborda su investigación y desarrollo, enfatizando la exploración meticulosa de cada nueva arquitectura de GPU para extraer el máximo rendimiento. A pesar del prometedor potencial de la tecnología de Kog, el camino por delante es desafiante. La optimización del rendimiento para cada nueva generación de GPU requiere pruebas y refinamientos extensos, que a menudo toman varias semanas o incluso meses por dispositivo. Este proceso es a la vez intensivo en mano de obra y altamente técnico, lo que refleja la profundidad de la experiencia requerida para superar los límites del hardware convencional.
Si tiene éxito, la puesta en marcha podría ofrecer una alternativa viable a los chips de IA especializados que actualmente dominan el mercado, proporcionando a las empresas un medio más flexible y rentable para mejorar sus capacidades de IA.
★
Mantengamos las noticias honestas.
ObjectiveNews se financia con los lectores y no tiene anuncios: te mostramos el sesgo en lugar de ocultarlo. Apoya el periodismo independiente por 4 €/mes.
Hazte suscriptor