Benchmark Solverys · 23 avril 2026
Qwen 3 27B 4-bit sur RTX 4090 avec vLLM
Une mesure de terrain pour comprendre ce qu’un modèle ouvert de 27 milliards de paramètres permet réellement sur un GPU 24 Go loué à l’heure.
La réponse courte
Solverys a observé 15 à 20 tokens par seconde en génération, avec environ 18 Go de VRAM chargée. Le GPU RunPod était facturé 0,69 $/h, hors stockage.
Simuler mon volumeMesures et environnement
Les absences sont conservées telles quelles.
- Modèle
- Qwen 3 27B Source éditoriale Solverys
- Quantification
- 4-bit Unsloth Configuration mesurée
- GPU
- RTX 4090 · 24 Go RunPod
- Runtime
- vLLM API OpenAI-compatible
- VRAM chargée
- ≈ 18 Go Mesuré
- Débit de génération
- 15–20 tok/s Mesuré
- Prefill
- Non mesuré Aucun débit estimé
- TTFT
- Non mesuré Aucune latence estimée
- Temps de chargement
- ≈ 3 minutes Première requête
- Contexte utilisable observé
- Jusqu’à 20k tokens 32k annoncés par le modèle
Le coût observé
Le stockage persistant compte même quand le GPU est arrêté. Le Lab sépare donc heure active et heure possédée.
- GPU actif
- 0,69 $ / h
- Stockage, pod actif
- 0,008 $ / h
- Stockage, pod arrêté
- 0,011 $ / h
- 40 h actives + 128 h arrêtées
- 29,33 $
Lecture Solverys
Pertinent pour absorber les tâches répétitives, pas pour remplacer un modèle frontière.
Le modèle produit une première passe utilisable sur des scripts, requêtes SQL, composants isolés et recherches ciblées dans une base de code. Une relecture reste nécessaire.
La qualité chute avec le contexte long et les tâches qui cumulent plusieurs contraintes. L’intervalle de 85 à 90 % est une observation de travail, pas une métrique académique comparable entre modèles.
Lire l’expérience complète et ses limites →Vous voulez mesurer votre propre pipeline ?
Solverys peut établir un protocole, exécuter le benchmark et traduire les résultats en coût de production.