NVIDIA: Qwen3.8-27B läuft auf RTX 5090 mit 131 Token pro Sekunde

NVIDIA unterstützt das Sprachmodell Qwen3.8-27B zum Start auf RTX- und DGX-Hardware. Auf einer einzelnen GeForce RTX 5090 erreicht das Modell laut NVIDIA 131 Token pro Sekunde, unterstützt durch Multi-Token-Prediction.

Lokale Coding-Agenten mit RTX und DGX

Entwickler können Qwen3.8-27B unter anderem mit llama.cpp, Ollama, Unsloth und LM Studio Bionic einsetzen. NVIDIA nennt neben RTX-Grafikkarten auch DGX Spark und DGX Station als unterstützte Systeme.

Die lokale Ausführung richtet sich an interaktive Coding-Agenten und andere Anwendungen, bei denen Antworten ohne entfernten Dienst verarbeitet werden sollen. Eine NVFP4-Optimierung für weitere NVIDIA-Local-AI-Geräte soll folgen.

Die Modellvarianten stehen unter anderem bei Ollama und Hugging Face bereit.

Weitere News

Weitere News

Kommentieren Sie den Artikel

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein