Faire tourner un modèle sur le poste, ou dans un local technique, change une chose importante : moins de requêtes partent chez un fournisseur. On a trop vite conclu que cela changeait tout le reste.
La première quinzaine d’août a multiplié les démonstrations de modèles compacts pensés pour l’exécution locale et pour des agents. Liquid AI a présenté LFM2.5-2.6B puis une variante multimodale pour le bord. Meta a remis en circulation Muse Glimmer, agentique, locale, open source. Ce sont des signaux techniques utiles. Ce ne sont pas des certificats de souveraineté.
Ce que le local règle vraiment
Le local réduit certains transferts. Il peut améliorer la latence. Il peut rendre un usage possible sans abonnement permanent. Il peut, si l’architecture est propre, faciliter un fonctionnement dégradé.
Il ne dit pas qui a le droit d’agir. Il ne dit pas sur quelles données. Il ne dit pas comment on journalise une action, ni comment on l’arrête. Un agent qui lit le courrier, ouvre un navigateur ou écrit dans un dossier d’entreprise pose les mêmes questions sur un portable que derrière une API.
Nous avions déjà montré qu’un serveur sous le bureau n’est pas un talisman. Il faut ajouter ceci : un agent sous le bureau n’est pas davantage un talisman.
L’injection de prompt ne s’arrête pas à la frontière du cloud
OWASP classe l’injection de prompt comme une vulnérabilité structurelle des systèmes à base de LLM. Le référentiel LLM01:2025 le rappelle sans ambiguïté : il n’existe pas de parade totale, notamment parce que le modèle ne sépare pas toujours instructions de confiance et contenu non fiable.
Cette faille ne dépend pas du lieu d’hébergement. Un document interne, une page web, un courriel ou une image peuvent porter une consigne. Si l’agent a des droits trop larges, la consigne s’exécute ici, pas « dans le cloud ». Le périmètre réseau n’est plus le bon dessin de la confiance.
Les techniques de RAG ou de fine-tuning, souvent présentées comme des remèdes, ne suppriment pas cette classe de risque. Elles peuvent la réduire dans certains cas. Les prendre pour une clôture serait une erreur de conception.
Le mandat avant le modèle
La question utile pour une PME n’est donc plus seulement « on-premise ou API ? ». Elle devient : que l’agent a-t-il le droit de faire, avec quelles preuves, jusqu’où, et qui peut couper.
Un modèle compact bien choisi peut rester local pour la classification, la recherche interne ou l’assistance à la rédaction. Dès qu’il enchaîne des outils — messagerie, fichiers, navigateur, tickets — il faut les mêmes contrôles que pour un compte à privilèges : moindre privilège, journal, révocation, jeu d’essai, responsabilité humaine.
Les annonces de la semaine valent comme matière. Elles montrent que l’inférence locale devient banale. Elles ne dispensent personne de dessiner le mandat. La souveraineté commence là, pas à l’adresse IP de la carte graphique.
