Pipecat dévoile PhoneLLM Alpha 1, un modèle ouvert pour agents vocaux dérivé de Nemotron
D'après Fiche du modèle PhoneLLM Alpha 1 sur Hugging Face (Pipecat), relayé par X (@kwindla)
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- PhoneLLM Alpha 1 n'est pas entraîné de zéro : c'est un réglage fin à pleins paramètres du modèle NVIDIA Nemotron 3 Nano 30B-A3B, précise la fiche du modèle publiée par Pipecat sur Hugging Face.
- Le nom même du dépôt (phonellm-alpha-1) et le titre de la fiche l'indiquent : il s'agit d'une version alpha, pas d'un modèle présenté comme stable pour la production.
- Le pipeline déclaré sur Hugging Face est « text-generation » : PhoneLLM ne parle ni n'écoute lui-même, il joue le rôle du cerveau conversationnel dans une chaîne où d'autres modèles font la reconnaissance et la synthèse de la parole.
- Sur 30 milliards de paramètres au total, seuls 3,5 milliards s'activent à chaque appel (architecture à mélange d'experts), ce qui explique la faible latence annoncée.
- PhoneLLM est distribué sous licence BSD 2-Clause, une licence réellement permissive, sans restriction commerciale - une denrée plus rare qu'il n'y paraît chez les modèles dits « ouverts ».
Pourquoi ça compte
Beaucoup de modèles « raisonnants » répondent trop lentement pour une conversation téléphonique naturelle. Et Pipecat affirme avoir constaté, dans son propre travail de création d'agents vocaux, que plusieurs petits modèles peinent à réellement déclencher les bons outils (réserver, transférer un appel) plutôt que de simplement prétendre l'avoir fait. Pipecat cible directement ce compromis latence-fiabilité, un enjeu concret pour toute entreprise qui envisage d'automatiser un centre d'appels.
Chiffre-clé
Selon Pipecat (fiche du modèle, 27 août 2026), PhoneLLM répond en moins de 600 ms (95e centile, réseau compris) sur un GPU Nvidia B200, pour environ 0,0025 $ US la minute d'appel pour la seule composante LLM (hors reconnaissance et synthèse de la parole), contre environ 1 900 ms de premier jeton pour GPT 5.6 Terra en mode rapide. Chiffres du fabricant, non vérifiés de façon indépendante.
Citation
« PhoneLLM is a full-weights fine-tune of NVIDIA Nemotron Nano 30B. » Kwindla Hultman Kramer, créateur de Pipecat (@kwindla)
Action concrète
Les poids de PhoneLLM sont publics sur Hugging Face (dépôt pipecat-ai/phonellm-alpha-1) : quiconque évalue une solution d'agent vocal peut les essayer sur ses propres scénarios avant de les envisager en production, en gardant à l'esprit le statut alpha du modèle.
« Introducing PhoneLLM, an open model for voice agents. GPT 5.6 Terra performance on typical voice agent tasks at 1/3 the latency and 1/18 the cost. »
Fondée sur la source originale
Sources
🔧 Outils mentionnés