
Des scores IA proches cachent des modèles très différents
DeepSWE place Luna Max à 2,2 points de Sol High pour près d’un sixième du coût. J’explique pourquoi leur façon de travailler reste très différente.
Page 3 sur 3

DeepSWE place Luna Max à 2,2 points de Sol High pour près d’un sixième du coût. J’explique pourquoi leur façon de travailler reste très différente.

J'ai créé un système de gestion du contexte en quatre couches qui guide mes agents vers les faits à jour. Il fonctionne, mais sa maintenance reste difficile.

J'ai comparé Sol, Terra, Opus 5 et Fable 5 sur des benchmarks de code. Le gagnant change selon la tâche, le niveau d'effort, l'agent et le budget.

Kimi K3 égale GPT-5.6 medium, mais prend 4,6 fois plus de temps. GLM-5.2 coûte peu par token, mais cher par tâche. J’ai vérifié où chacun excelle.

Appwrite et InsForge s'en approchent, mais Convex reste plus simple pour mes agents d'IA. Le prix de l'hébergement dans l'UE est son vrai défaut.

Dans mon audit, GPT-5.6 Sol a trouvé près de six fois plus de problèmes possibles que Fable 5. La plupart ont échoué au triage, alors j'ai changé de méthode.

Opus 5 égale Fable 5 sur les benchmarks pour un prix par token réduit de moitié, mais le superviser reste pénible. Voici pourquoi Fable garde sa place.