Benchmark Solverys · 23 avril 2026

Qwen 3 27B 4-bit sur RTX 4090 avec vLLM

Une mesure de terrain pour comprendre ce qu’un modèle ouvert de 27 milliards de paramètres permet réellement sur un GPU 24 Go loué à l’heure.

La réponse courte

Solverys a observé 15 à 20 tokens par seconde en génération, avec environ 18 Go de VRAM chargée. Le GPU RunPod était facturé 0,69 $/h, hors stockage.

Simuler mon volume

Mesures et environnement

Les absences sont conservées telles quelles.

Modèle
Qwen 3 27B
Source éditoriale Solverys
Quantification
4-bit Unsloth
Configuration mesurée
GPU
RTX 4090 · 24 Go
RunPod
Runtime
vLLM
API OpenAI-compatible
VRAM chargée
≈ 18 Go
Mesuré
Débit de génération
15–20 tok/s
Mesuré
Prefill
Non mesuré
Aucun débit estimé
TTFT
Non mesuré
Aucune latence estimée
Temps de chargement
≈ 3 minutes
Première requête
Contexte utilisable observé
Jusqu’à 20k tokens
32k annoncés par le modèle

Le coût observé

Le stockage persistant compte même quand le GPU est arrêté. Le Lab sépare donc heure active et heure possédée.

GPU actif
0,69 $ / h
Stockage, pod actif
0,008 $ / h
Stockage, pod arrêté
0,011 $ / h
40 h actives + 128 h arrêtées
29,33 $

Lecture Solverys

Pertinent pour absorber les tâches répétitives, pas pour remplacer un modèle frontière.

Le modèle produit une première passe utilisable sur des scripts, requêtes SQL, composants isolés et recherches ciblées dans une base de code. Une relecture reste nécessaire.

La qualité chute avec le contexte long et les tâches qui cumulent plusieurs contraintes. L’intervalle de 85 à 90 % est une observation de travail, pas une métrique académique comparable entre modèles.

Lire l’expérience complète et ses limites →

Vous voulez mesurer votre propre pipeline ?

Solverys peut établir un protocole, exécuter le benchmark et traduire les résultats en coût de production.

Parler du benchmark