Aller au contenu

Documentation vLLM-MLX

Backend MLX pour Apple Silicon sur vLLM - Accélération GPU pour le texte, les images, la vidéo et l'audio sur Mac

Qu'est-ce que vLLM-MLX ?

vllm-mlx apporte l'accélération GPU native d'Apple Silicon à vLLM en intégrant :

  • MLX : le framework ML d'Apple avec mémoire unifiée et noyaux Metal
  • mlx-lm : inférence LLM optimisée avec KV cache et quantification
  • mlx-vlm : modèles vision-langage (VLM) pour l'inférence multimodale
  • mlx-audio : Text-to-Speech et Speech-to-Text avec des voix natives
  • mlx-embeddings : embeddings textuels pour la recherche sémantique et le RAG

Fonctionnalités principales

  • Multimodal - Texte, image, vidéo et audio sur une seule plateforme
  • Accélération GPU native sur Apple Silicon (M1, M2, M3, M4, M5)
  • Voix TTS natives - espagnol, français, chinois, japonais et 5 autres langues
  • Compatible API OpenAI - remplacement direct du client OpenAI
  • Embeddings - point de terminaison /v1/embeddings compatible OpenAI
  • MCP Tool Calling - intégration d'outils externes via le Model Context Protocol
  • Paged KV Cache - mise en cache efficace en mémoire avec partage de préfixe
  • Continuous Batching - débit élevé pour plusieurs utilisateurs simultanés

Liens rapides

Démarrage

Guides utilisateur

Référence

Benchmarks

Développement

Prérequis

  • macOS sur Apple Silicon (M1/M2/M3/M4/M5)
  • Python 3.10+
  • 8 Go de RAM recommandés

Licence

Apache 2.0. Consultez la licence du dépôt.