Documentation vLLM-MLX¶
Backend MLX pour Apple Silicon sur vLLM - Accélération GPU pour le texte, les images, la vidéo et l'audio sur Mac
Qu'est-ce que vLLM-MLX ?¶
vllm-mlx apporte l'accélération GPU native d'Apple Silicon à vLLM en intégrant :
- MLX : le framework ML d'Apple avec mémoire unifiée et noyaux Metal
- mlx-lm : inférence LLM optimisée avec KV cache et quantification
- mlx-vlm : modèles vision-langage (VLM) pour l'inférence multimodale
- mlx-audio : Text-to-Speech et Speech-to-Text avec des voix natives
- mlx-embeddings : embeddings textuels pour la recherche sémantique et le RAG
Fonctionnalités principales¶
- Multimodal - Texte, image, vidéo et audio sur une seule plateforme
- Accélération GPU native sur Apple Silicon (M1, M2, M3, M4, M5)
- Voix TTS natives - espagnol, français, chinois, japonais et 5 autres langues
- Compatible API OpenAI - remplacement direct du client OpenAI
- Embeddings - point de terminaison
/v1/embeddingscompatible OpenAI - MCP Tool Calling - intégration d'outils externes via le Model Context Protocol
- Paged KV Cache - mise en cache efficace en mémoire avec partage de préfixe
- Continuous Batching - débit élevé pour plusieurs utilisateurs simultanés
Liens rapides¶
Démarrage¶
Guides utilisateur¶
- Serveur compatible OpenAI
- API Python
- Multimodal (images et vidéo)
- Audio (STT/TTS)
- Embeddings
- Modèles de reasoning
- Tool Calling
- MCP et Tool Calling
- Continuous Batching
Référence¶
Benchmarks¶
Développement¶
Prérequis¶
- macOS sur Apple Silicon (M1/M2/M3/M4/M5)
- Python 3.10+
- 8 Go de RAM recommandés
Licence¶
Apache 2.0. Consultez la licence du dépôt.