Kog accélère l'inférence IA 30x sur GPU standards
Kog, une startup française, mise sur l'optimisation logicielle pour booster les performances d'inférence IA sur les GPU standards comme les AMD MI300X et NVIDIA H200. Leur démo a atteint 3 000 tokens par seconde avec un modèle Laneformer 2B open-source. Le CEO Gaël Delalleau vise 30x plus rapide pour les LLM.
« "We had 200 tangible business leads," CEO Gaël Delalleau told TechCrunch. » - Anna Heim, TechCrunch AI · 14 août 2026 · Voir l'article original →
Que faut-il retenir ?
- Kog a démontré 3 000 tokens par seconde avec son modèle Laneformer 2B sur GPU standards.
- La startup promet une accélération 30x de l'inférence LLM sans nouveau matériel.
- 200 prospects business concrets après la démo technique en mai 2026.
- Le CEO prévoit plusieurs semaines/mois d'adaptation par nouveau GPU.
Pourquoi cette nouvelle compte-t-elle ?
L'optimisation logicielle des GPU existants pourrait réduire drastiquement les coûts d'inférence IA tout en augmentant les performances. Cela répond à un besoin critique des entreprises qui utilisent des workflows IA professionnels, notamment en génération de code où la vitesse impacte directement la productivité. La solution évite des investissements matériels lourds.
3 000 tokens par seconde en démo avec Laneformer 2B
💬 Gaël Delalleau, CEO de Kog
Public concerné : développeurs, entreprises
Comment Kog accélère-t-il l'inférence IA sur GPU sans nouveau matériel ?
Kog utilise une optimisation logicielle poussée au niveau assembleur pour exploiter au maximum la bande passante mémoire des GPU existants. Leur approche nécessite plusieurs semaines d'adaptation par modèle de GPU mais évite des investissements matériels.
🔧 Outils mentionnés