Saltar a contenido

Documentación de vLLM-MLX

Backend MLX para Apple Silicon en vLLM - Aceleración GPU para texto, imagen, video y audio en Mac

¿Qué es vLLM-MLX?

vllm-mlx incorpora aceleración GPU nativa de Apple Silicon a vLLM mediante la integración de:

  • MLX: El framework de ML de Apple con memoria unificada y kernels Metal
  • mlx-lm: Inferencia LLM optimizada con KV cache y cuantización
  • mlx-vlm: Modelos visión-lenguaje para inferencia multimodal
  • mlx-audio: TTS y STT con voces nativas
  • mlx-embeddings: Embeddings de texto para búsqueda semántica y RAG

Características principales

  • Multimodal - Texto, imagen, video y audio en una sola plataforma
  • Aceleración GPU nativa en Apple Silicon (M1, M2, M3, M4, M5)
  • Voces TTS nativas - Español, francés, chino, japonés y 5 idiomas más
  • Compatible con la API de OpenAI - reemplazo directo del cliente de OpenAI
  • Embeddings - Endpoint /v1/embeddings compatible con OpenAI
  • MCP Tool Calling - integración de herramientas externas mediante el Model Context Protocol
  • Paged KV Cache - almacenamiento en caché eficiente en memoria con prefix sharing
  • Continuous Batching - alto rendimiento para múltiples usuarios concurrentes

Enlaces rápidos

Primeros pasos

Guías de usuario

Referencia

Benchmarks

Desarrollo

Requisitos

  • macOS en Apple Silicon (M1/M2/M3/M4/M5)
  • Python 3.10+
  • Se recomiendan 8 GB de RAM o más

Licencia

Apache 2.0. Consulta la licencia del repositorio.