![]() |
La plupart des configurations locales fonctionnent très bien avec deux ou trois modèles polyvalents et performants qui se répartissent le travail. Qwen et Gemma gèrent tous les deux la plupart de mes tâches quotidiennes, j’ai donc toujours tendance à les utiliser par défaut. Cependant, se limiter à un ou deux modèles seulement n’est pas la meilleure approche pour les LLM locaux, surtout si vous utilisez du matériel standard incapable de prendre en charge les modèles plus volumineux capables de gérer tout ce que vous leur confiez. Il vaut mieux répartir le travail par tâche entre plusieurs modèles.
Il y avait un modèle que je repoussais sans cesse, principalement parce que je ne comprenais pas tout à fait en quoi il consistait. DeepSeek R1 Distill revenait sans cesse dans toutes les discussions sur les LLM locaux que je suivais, et au début, j’avais du mal à voir en quoi il était si différent des modèles que j’utilisais déjà. Mais il s’est avéré être le spécialiste dont j’ignorais avoir besoin…
Qu'est-ce que DeepSeek R1 Distill, au juste ?
DeepSeek s’est forgé une réputation grâce à R1, un modèle de raisonnement entraîné principalement par apprentissage avec renforcement, plutôt que par l’approche sous supervision sur laquelle s’appuient encore la plupart des laboratoires. Ce modèle a obtenu des résultats proches de ceux d’o1 d’OpenAI lors de tests de performance en mathématiques et en programmation, ce qui a attiré l’attention d’un public au-delà des cercles de recherche habituels.
Ce qui m’a laissé perplexe, c’est que R1 n’est pas réellement le modèle que la plupart des gens exécutent localement. DeepSeek a exploité le raisonnement produit par R1, a généré environ 800 000 exemples illustrant sa manière d’aborder les problèmes, puis s’en est servi pour réentraîner une poignée de modèles ouverts existants, au lieu de proposer un produit distillé unique. C’est pourquoi on trouve à la fois une version Llama et une version Qwen portant exactement le même nom « DeepSeek », ce qui m’a d’abord induit en erreur. En gros, c’est comme avoir le même professeur mais des élèves différents.
Ce processus a donné naissance à six tailles, allant de 1,5 milliard à 70 milliards, réparties entre les bases Llama et Qwen, et le choix de l’une ou l’autre modifie réellement ce que vous obtenez, et pas seulement la vitesse d’exécution. Llama 8B a l’avantage sur les benchmarks axés sur le code, tandis que Qwen 7B prend le dessus dès qu’il s’agit de mathématiques et de raisonnement général ; choisir n’importe lequel portant la mention « DeepSeek » ne vous apprend donc pas grand-chose en soi.
Mettre le modèle à l'épreuve
J'ai finalement opté pour DeepSeek R1 Distill Llama 8B, et mon premier test concernait une devinette : celle du fermier qui possède 17 moutons, où toute la subtilité réside dans la formulation. Le bloc de raisonnement qu’il a généré était long : il a redéfini sa propre logique à l’aide d’un cas de test plus simple, juste pour vérifier son raisonnement avant de donner une réponse, et il a fini par trouver la bonne solution. Je ne sais toutefois pas encore si cette approche est rigoureuse ou simplement excessive pour une devinette aussi simple.
Mais l’enjeu d’une devinette est faible ; le véritable test consistait donc à traiter des situations plus complexes et des tâches pour lesquelles il n’existe pas de réponse unique et claire. J’ai extrait le code brut directement des outils de développement d’un site en ligne et j’ai demandé une évaluation heuristique selon la méthode de Nielsen. Ce qui m’a marqué, ce n’était pas tant le verdict que le fait de le voir vérifier les noms de classes et les styles réels par rapport à chaque heuristique, au lieu de se contenter de la réponse générique qui apparaît généralement en premier. Il a signalé le bouton « S’inscrire » comme un problème de visibilité, a relevé que le style de la balise de paragraphe donnait l’impression qu’il s’agissait de texte de corps plutôt que d’une action, et a passé en revue la navigation et la cohérence sans que j’aie besoin de le guider.
L'exemple le plus parlant est celui de trois plaintes d'utilisateurs concernant l'expérience utilisateur (UX) que je lui ai soumises ; celles-ci n'étaient pas liées entre elles, et la demande portait sur une cause première unique plutôt que sur trois solutions distinctes. Le système a d'abord traité chaque plainte individuellement, puis est revenu en arrière pour tester plusieurs explications concurrentes avant de se fixer sur une seule. Et c'est précisément cette phase de retour en arrière qui illustre parfaitement pourquoi la « réflexion visible » revêt une telle importance. On n’obtient pas simplement une réponse, on observe le processus qui élimine d’abord les hypothèses les moins plausibles.
Il vous faut plusieurs modèles
Cela ne signifie pas pour autant que Qwen et Gemma soient désinstallés, et ce n’est d’ailleurs pas vraiment l’argument que j’avance, puisque tous deux continuent d’assurer l’essentiel du travail quotidien.
Le véritable problème, c’est le matériel. Personne disposant d’un simple GPU grand public ne trouve de modèle de 70 milliards de paramètres qui couvre bien tous les cas de figure, principalement parce que ce niveau de performance n’existe pratiquement pas pour des tailles de modèles que l’on peut réellement exécuter chez soi. La meilleure stratégie consiste donc à adapter le modèle à la tâche à accomplir, plutôt que de chercher un modèle qui fasse tout.
Mon stack local* ne cesse de s'agrandir
Je pense que celui-ci mérite une place permanente, sans pour autant évincer les autres. Qwen et Gemma continuent d'assurer l'essentiel de ce dont j'ai besoin de la part d'un modèle local. Ce que m'apporte DeepSeek R1 Distill, c'est un modèle auquel j'ai réellement confiance pour les tâches faisant largement appel au raisonnement, un domaine dans lequel les deux autres peuvent parfois montrer des faiblesses.
Gemma couvre son domaine habituel, Qwen prend en charge une grande partie des tâches à lui seul, et ce modèle « Distill » vient compléter le reste, principalement les cas où il est aussi important d’observer le raisonnement que d’obtenir la réponse. Ma propre configuration le confirme déjà : je n’utilise pas un seul modèle pour tout, mais plusieurs, et chacun a sa place pour une raison différente. Savoir lequel choisir, et à quel moment, s’est avéré être la véritable compétence à développer ici.
* = environnement local
traduction de : https://www.xda-developers.com/stopped-using-qwen-and-gemma-after-finding-local-llm-that-thinks-before-answering/

Enregistrer un commentaire
Les commentaires sont validés manuellement avant publication. Il est normal que ceux-ci n'apparaissent pas immédiatement.