NVIDIA unterstützt das Sprachmodell Qwen3.8-27B zum Start auf RTX- und DGX-Hardware. Auf einer einzelnen GeForce RTX 5090 erreicht das Modell laut NVIDIA 131 Token pro Sekunde, unterstützt durch Multi-Token-Prediction.
Lokale Coding-Agenten mit RTX und DGX
Entwickler können Qwen3.8-27B unter anderem mit llama.cpp, Ollama, Unsloth und LM Studio Bionic einsetzen. NVIDIA nennt neben RTX-Grafikkarten auch DGX Spark und DGX Station als unterstützte Systeme.
Die lokale Ausführung richtet sich an interaktive Coding-Agenten und andere Anwendungen, bei denen Antworten ohne entfernten Dienst verarbeitet werden sollen. Eine NVFP4-Optimierung für weitere NVIDIA-Local-AI-Geräte soll folgen.
Die Modellvarianten stehen unter anderem bei Ollama und Hugging Face bereit.
