Théo Hubert
"Mon modèle ne tient pas sur une puce embarquée"
Théo Hubert · Pour ceux qui implémentent · 11:15 · 40 min
"Mon modèle ne tient pas sur une puce embarquée"
Small language models, fine-tuning & compression
Aujourd’hui, l’IA est majoritairement consommée dans le Cloud. Mais peut-on faire autrement ? L’objectif de cette prise de parole est de montrer concrètement comment faire tourner localement un modèle de langage performant, sur un PC ou une carte comme la Jetson Nano.
Sur un environnement contraint, réduire la taille arbitrairement d’un modèle ne suffit pas. Nous verrons comment les SLM (Small Language Models) permettent de conserver de bonnes performances grâce à différentes approches : trimming, quantification, pruning et fine-tuning. Nous irons ensuite plus loin en comparant ces techniques d’optimisation à une autre approche : concevoir des architectures nativement pensées pour l’Edge, et donc adaptées dès l’origine aux contraintes de calcul.