Documentación de vLLM-MLX¶
Backend MLX para Apple Silicon en vLLM - Aceleración GPU para texto, imagen, video y audio en Mac
¿Qué es vLLM-MLX?¶
vllm-mlx incorpora aceleración GPU nativa de Apple Silicon a vLLM mediante la integración de:
- MLX: El framework de ML de Apple con memoria unificada y kernels Metal
- mlx-lm: Inferencia LLM optimizada con KV cache y cuantización
- mlx-vlm: Modelos visión-lenguaje para inferencia multimodal
- mlx-audio: TTS y STT con voces nativas
- mlx-embeddings: Embeddings de texto para búsqueda semántica y RAG
Características principales¶
- Multimodal - Texto, imagen, video y audio en una sola plataforma
- Aceleración GPU nativa en Apple Silicon (M1, M2, M3, M4, M5)
- Voces TTS nativas - Español, francés, chino, japonés y 5 idiomas más
- Compatible con la API de OpenAI - reemplazo directo del cliente de OpenAI
- Embeddings - Endpoint
/v1/embeddingscompatible con OpenAI - MCP Tool Calling - integración de herramientas externas mediante el Model Context Protocol
- Paged KV Cache - almacenamiento en caché eficiente en memoria con prefix sharing
- Continuous Batching - alto rendimiento para múltiples usuarios concurrentes
Enlaces rápidos¶
Primeros pasos¶
Guías de usuario¶
- Servidor compatible con OpenAI
- API de Python
- Multimodal (imágenes y video)
- Audio (STT/TTS)
- Embeddings
- Modelos de reasoning
- Tool Calling
- MCP y Tool Calling
- Continuous Batching
Referencia¶
Benchmarks¶
Desarrollo¶
Requisitos¶
- macOS en Apple Silicon (M1/M2/M3/M4/M5)
- Python 3.10+
- Se recomiendan 8 GB de RAM o más
Licencia¶
Apache 2.0. Consulta la licencia del repositorio.