vllm_mlx.multimodal_processor¶
Multimodal processor for VLM continuous batching.
View the complete module source at #L1-L431.
API details¶
Each callable below includes its exact signature, type annotations, inputs, defaults, return contract, documented exceptions, implementation source, and parsed docstring sections when the source provides them.
vllm_mlx.multimodal_processor
¶
Multimodal processor for VLM continuous batching.
This module handles preprocessing of multimodal inputs (images, videos) for use with the continuous batching scheduler. It extracts processed inputs that can be batched together efficiently.
vllm_mlx.multimodal_processor.ProcessedMultimodalInput
dataclass
¶
ProcessedMultimodalInput(input_ids: array, pixel_values: Optional[array] = None, attention_mask: Optional[array] = None, image_grid_thw: Optional[array] = None, num_images: int = 0, num_tokens: int = 0, extra_kwargs: Dict[str, Any] = dict())
Container for processed multimodal inputs ready for batching.
Attributes:
-
input_ids(array) –Tokenized text with image/video tokens (mx.array)
-
pixel_values(Optional[array]) –Processed image tensors (mx.array)
-
attention_mask(Optional[array]) –Attention mask for the input (mx.array)
-
image_grid_thw(Optional[array]) –Grid info for Qwen-VL models (mx.array)
-
num_images(int) –Number of images in this input
-
num_tokens(int) –Number of tokens in input_ids
-
extra_kwargs(Dict[str, Any]) –Additional model-specific kwargs
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.input_ids
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.pixel_values
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.attention_mask
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.image_grid_thw
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.num_images
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.num_tokens
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.ProcessedMultimodalInput.extra_kwargs
class-attribute
instance-attribute
¶
vllm_mlx.multimodal_processor.MultimodalProcessor
¶
Processor for preparing multimodal inputs for VLM batching.
This class wraps mlx_vlm's prepare_inputs function and provides a clean interface for the scheduler to preprocess requests.
Example
processor = MultimodalProcessor(model, vlm_processor) processed = processor.process( ... prompt="What's in this image?", ... images=["photo.jpg"] ... )
processed.input_ids, processed.pixel_values ready for batching¶
Initialize the multimodal processor.
Parameters:
-
model(Any) –The VLM model (for config access)
-
processor(Any) –The VLM processor (tokenizer + image processor)
-
config(Optional[Any], default:None) –Optional model config
Source code in vllm_mlx/multimodal_processor.py
vllm_mlx.multimodal_processor.MultimodalProcessor.processor
instance-attribute
¶
vllm_mlx.multimodal_processor.MultimodalProcessor.config
instance-attribute
¶
vllm_mlx.multimodal_processor.MultimodalProcessor.tokenizer
instance-attribute
¶
vllm_mlx.multimodal_processor.MultimodalProcessor.image_token_index
instance-attribute
¶
vllm_mlx.multimodal_processor.MultimodalProcessor.process
¶
process(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, video_fps: float = DEFAULT_FPS, video_max_frames: int = MAX_FRAMES, add_special_tokens: bool = True, **kwargs) -> ProcessedMultimodalInput
Process multimodal inputs for batching.
Parameters:
-
prompt(str) –Text prompt (already formatted with chat template)
-
images(Optional[List[str]], default:None) –List of image URLs or base64 strings
-
videos(Optional[List[str]], default:None) –List of video URLs or base64 inputs
-
video_fps(float, default:DEFAULT_FPS) –FPS for video frame extraction
-
video_max_frames(int, default:MAX_FRAMES) –Max frames per video
-
add_special_tokens(bool, default:True) –Whether to add special tokens
-
**kwargs–Additional model-specific parameters
Returns:
-
ProcessedMultimodalInput–ProcessedMultimodalInput with all processed tensors
Source code in vllm_mlx/multimodal_processor.py
96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 173 174 175 176 177 178 179 180 181 182 183 184 185 186 | |
vllm_mlx.multimodal_processor.MultimodalProcessor.process_for_request
¶
process_for_request(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, **kwargs) -> Dict[str, Any]
Process inputs and return a dict suitable for Request fields.
This is a convenience method that returns the processed data in a format that can be directly assigned to Request fields.
Parameters:
-
prompt(str) –Text prompt
-
images(Optional[List[str]], default:None) –List of image inputs
-
videos(Optional[List[str]], default:None) –List of video inputs
-
**kwargs–Additional parameters
Returns:
-
Dict[str, Any]–Dict with keys matching Request multimodal fields
Source code in vllm_mlx/multimodal_processor.py
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_pixel_values
¶
Batch multiple pixel_values tensors together.
For VLM batching, we need to concatenate pixel values from multiple requests. This handles the case where some requests may not have images.
Parameters:
-
pixel_values_list(List[Optional[array]]) –List of pixel_values from multiple requests
Returns:
-
Optional[array]–Batched pixel_values or None if no images
Source code in vllm_mlx/multimodal_processor.py
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_image_grid_thw
¶
Batch multiple image_grid_thw tensors together.
Parameters:
-
grid_thw_list(List[Optional[array]]) –List of image_grid_thw from multiple requests
Returns:
-
Optional[array]–Batched image_grid_thw or None
Source code in vllm_mlx/multimodal_processor.py
vllm_mlx.multimodal_processor.MultimodalProcessor.prepare_for_batch
¶
prepare_for_batch(processed_inputs: List[ProcessedMultimodalInput]) -> Tuple[array, Dict[str, Any], List[int]]
Prepare multiple processed inputs for batch generation.
This method takes a list of ProcessedMultimodalInput objects and combines them into batched tensors suitable for the MLLMBatchGenerator.
Parameters:
-
processed_inputs(List[ProcessedMultimodalInput]) –List of ProcessedMultimodalInput from process()
Returns:
-
array–Tuple of:
-
Dict[str, Any]–- input_ids: Left-padded input tokens [batch_size, max_seq_len]
-
List[int]–- batch_kwargs: Dict with batched pixel_values, attention_mask, etc.
-
Tuple[array, Dict[str, Any], List[int]]–- padding_amounts: List of padding amounts for each request
Source code in vllm_mlx/multimodal_processor.py
281 282 283 284 285 286 287 288 289 290 291 292 293 294 295 296 297 298 299 300 301 302 303 304 305 306 307 308 309 310 311 312 313 314 315 316 317 318 319 320 321 322 323 324 325 326 327 328 329 330 331 332 333 334 335 336 337 338 339 340 341 342 343 344 345 346 347 348 349 350 351 352 353 354 355 356 357 358 359 360 361 362 363 364 365 366 | |
vllm_mlx.multimodal_processor.MultimodalProcessor.extract_vision_embeddings
¶
Extract vision embeddings from pixel values.
This runs the vision encoder part of the VLM to get embeddings that can be cached and reused.
Parameters:
-
pixel_values(array) –Processed image tensors
-
image_grid_thw(Optional[array], default:None) –Optional grid info for Qwen-VL models
Returns:
-
array–Vision embeddings tensor
Source code in vllm_mlx/multimodal_processor.py
vllm_mlx.multimodal_processor.MultimodalProcessor.compute_vision_hash
¶
Compute a hash for pixel values for caching purposes.
Parameters:
-
pixel_values(array) –Processed image tensors
Returns:
-
str–Hash string for the vision inputs
Source code in vllm_mlx/multimodal_processor.py
Complete contract reference¶
Expand any definition for its exact inputs, annotations, defaults, return contract, directly raised exceptions, source-grounded behavior, and immutable line link. This section includes private and nested definitions that ordinary API generators omit.
vllm_mlx.multimodal_processor.ProcessedMultimodalInput · class
vllm_mlx.multimodal_processor.ProcessedMultimodalInput(input_ids: mx.array, pixel_values: Optional[mx.array] = None, attention_mask: Optional[mx.array] = None, image_grid_thw: Optional[mx.array] = None, num_images: int = 0, num_tokens: int = 0, extra_kwargs: Dict[str, Any] = field(default_factory=dict))
Container for processed multimodal inputs ready for batching.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
input_ids |
mx.array |
yes |
none |
Required constructor field. |
pixel_values |
Optional[mx.array] |
no |
None |
Optional constructor field; defaults to None. |
attention_mask |
Optional[mx.array] |
no |
None |
Optional constructor field; defaults to None. |
image_grid_thw |
Optional[mx.array] |
no |
None |
Optional constructor field; defaults to None. |
num_images |
int |
no |
0 |
Optional constructor field; defaults to 0. |
num_tokens |
int |
no |
0 |
Optional constructor field; defaults to 0. |
extra_kwargs |
Dict[str, Any] |
no |
field(default_factory=dict) |
Optional constructor field; defaults to field(default_factory=dict). |
Returns
- Constructs:
vllm_mlx.multimodal_processor.ProcessedMultimodalInput
Exceptions and behavior
Class ProcessedMultimodalInput declares 0 direct member(s).
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor · class
vllm_mlx.multimodal_processor.MultimodalProcessor(model: Any, processor: Any, config: Optional[Any] = None)
Processor for preparing multimodal inputs for VLM batching.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
model |
Any |
yes |
none |
The VLM model (for config access) |
processor |
Any |
yes |
none |
The VLM processor (tokenizer + image processor) |
config |
Optional[Any] |
no |
None |
Optional model config |
Returns
- Constructs:
vllm_mlx.multimodal_processor.MultimodalProcessor
Exceptions and behavior
Class MultimodalProcessor declares 8 direct member(s).
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.__init__ · method
vllm_mlx.multimodal_processor.MultimodalProcessor.__init__(model: Any, processor: Any, config: Optional[Any] = None) -> not annotated
Initialize the multimodal processor.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
model |
Any |
yes |
none |
The VLM model (for config access) |
processor |
Any |
yes |
none |
The VLM processor (tokenizer + image processor) |
config |
Optional[Any] |
no |
None |
Optional model config |
Returns
- Type:
not annotated
Exceptions and behavior
Method MultimodalProcessor.__init__ updates self.model, self.processor, self.config, self.tokenizer; calls getattr, hasattr.
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.process · method
vllm_mlx.multimodal_processor.MultimodalProcessor.process(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, video_fps: float = DEFAULT_FPS, video_max_frames: int = MAX_FRAMES, add_special_tokens: bool = True, **kwargs) -> ProcessedMultimodalInput
Process multimodal inputs for batching.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
prompt |
str |
yes |
none |
Text prompt (already formatted with chat template) |
images |
Optional[List[str]] |
no |
None |
List of image URLs or base64 strings |
videos |
Optional[List[str]] |
no |
None |
List of video URLs or base64 inputs |
video_fps |
float |
no |
DEFAULT_FPS |
FPS for video frame extraction |
video_max_frames |
int |
no |
MAX_FRAMES |
Max frames per video |
add_special_tokens |
bool |
no |
True |
Whether to add special tokens |
**kwargs |
not annotated |
no |
none |
Additional model-specific parameters |
Returns
- Type:
ProcessedMultimodalInput - Direct return expressions:
ProcessedMultimodalInput(input_ids=input_ids, pixel_values=pixel_values, attention_mask=attention_mask, image_grid_thw=…
Exceptions and behavior
Method MultimodalProcessor.process calls process_image_input, all_images.append, logger.warning, process_video_input; returns ProcessedMultimodalInput(input_ids=input_ids, pixel_values=pixel_values, attention_mask=attention_mask, image_grid_thw=….
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.process_for_request · method
vllm_mlx.multimodal_processor.MultimodalProcessor.process_for_request(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, **kwargs) -> Dict[str, Any]
Process inputs and return a dict suitable for Request fields.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
prompt |
str |
yes |
none |
Text prompt |
images |
Optional[List[str]] |
no |
None |
List of image inputs |
videos |
Optional[List[str]] |
no |
None |
List of video inputs |
**kwargs |
not annotated |
no |
none |
Additional parameters |
Returns
- Type:
Dict[str, Any] - Direct return expressions:
{'prompt_token_ids': processed.input_ids.tolist() if processed.input_ids is not None else None, 'num_prompt_tokens': pr…
Exceptions and behavior
Method MultimodalProcessor.process_for_request calls self.process, processed.input_ids.tolist; returns {'prompt_token_ids': processed.input_ids.tolist() if processed.input_ids is not None else None, 'num_prompt_tokens': pr….
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_pixel_values · method
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_pixel_values(pixel_values_list: List[Optional[mx.array]]) -> Optional[mx.array]
Batch multiple pixel_values tensors together.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
pixel_values_list |
List[Optional[mx.array]] |
yes |
none |
List of pixel_values from multiple requests |
Returns
- Type:
Optional[mx.array] - Direct return expressions:
None;mx.concatenate(valid_pixels, axis=0);valid_pixels[0] if valid_pixels else None
Exceptions and behavior
Method MultimodalProcessor.batch_pixel_values calls mx.concatenate, logger.warning; has 3 explicit return paths.
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_image_grid_thw · method
vllm_mlx.multimodal_processor.MultimodalProcessor.batch_image_grid_thw(grid_thw_list: List[Optional[mx.array]]) -> Optional[mx.array]
Batch multiple image_grid_thw tensors together.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
grid_thw_list |
List[Optional[mx.array]] |
yes |
none |
List of image_grid_thw from multiple requests |
Returns
- Type:
Optional[mx.array] - Direct return expressions:
None;mx.concatenate(valid_grids, axis=0);valid_grids[0] if valid_grids else None
Exceptions and behavior
Method MultimodalProcessor.batch_image_grid_thw calls mx.concatenate, logger.warning; has 3 explicit return paths.
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.prepare_for_batch · method
vllm_mlx.multimodal_processor.MultimodalProcessor.prepare_for_batch(processed_inputs: List[ProcessedMultimodalInput]) -> Tuple[mx.array, Dict[str, Any], List[int]]
Prepare multiple processed inputs for batch generation.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
processed_inputs |
List[ProcessedMultimodalInput] |
yes |
none |
List of ProcessedMultimodalInput from process() |
Returns
- Type:
Tuple[mx.array, Dict[str, Any], List[int]] - Direct return expressions:
(mx.array([]), {}, []);(input_ids, batch_kwargs, padding_amounts)
Exceptions and behavior
Method MultimodalProcessor.prepare_for_batch calls mx.array, max, zip, padded_ids.append; has 2 explicit return paths.
No direct raise statement appears in this definition.
vllm_mlx.multimodal_processor.MultimodalProcessor.extract_vision_embeddings · method
vllm_mlx.multimodal_processor.MultimodalProcessor.extract_vision_embeddings(pixel_values: mx.array, image_grid_thw: Optional[mx.array] = None) -> mx.array
Extract vision embeddings from pixel values.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
pixel_values |
mx.array |
yes |
none |
Processed image tensors |
image_grid_thw |
Optional[mx.array] |
no |
None |
Optional grid info for Qwen-VL models |
Returns
- Type:
mx.array - Direct return expressions:
embeddings
Exceptions and behavior
Method MultimodalProcessor.extract_vision_embeddings calls hasattr, ValueError, getattr, vision_encoder; can raise ValueError; returns embeddings.
Directly raised exceptions: ValueError.
vllm_mlx.multimodal_processor.MultimodalProcessor.compute_vision_hash · method
vllm_mlx.multimodal_processor.MultimodalProcessor.compute_vision_hash(pixel_values: mx.array) -> str
Compute a hash for pixel values for caching purposes.
Parameters
| Name | Type | Required | Default | Description |
|---|---|---|---|---|
pixel_values |
mx.array |
yes |
none |
Processed image tensors |
Returns
- Type:
str - Direct return expressions:
hashlib.sha256(hash_input.encode()).hexdigest()[:16]
Exceptions and behavior
Method MultimodalProcessor.compute_vision_hash calls str, pixel_values.reshape(-1)[:100].tolist, pixel_values.reshape, hashlib.sha256(hash_input.encode()).hexdigest; returns hashlib.sha256(hash_input.encode()).hexdigest()[:16].
No direct raise statement appears in this definition.
Complete symbol map¶
This map also includes private definitions and nested helpers. The signature column exposes every explicit input even when an internal helper has no dedicated parameter prose.
| Symbol | Kind | Signature and inputs | What it does | Source |
|---|---|---|---|---|
ProcessedMultimodalInput |
class | ProcessedMultimodalInput(input_ids: mx.array, pixel_values: Optional[mx.array] = None, attention_mask: Optional[mx.array] = None, image_grid_thw: Optional[mx.array] = None, num_images: int = 0, num_tokens: int = 0, extra_kwargs: Dict[str, Any] = field(default_factory=dict)) |
Container for processed multimodal inputs ready for batching. | #L29-L49 |
MultimodalProcessor |
class | MultimodalProcessor(model: Any, processor: Any, config: Optional[Any] = None) |
Processor for preparing multimodal inputs for VLM batching. | #L52-L431 |
MultimodalProcessor.__init__ |
method | MultimodalProcessor.__init__(model: Any, processor: Any, config: Optional[Any] = None) -> not annotated |
Initialize the multimodal processor. | #L68-L94 |
MultimodalProcessor.process |
method | MultimodalProcessor.process(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, video_fps: float = DEFAULT_FPS, video_max_frames: int = MAX_FRAMES, add_special_tokens: bool = True, **kwargs) -> ProcessedMultimodalInput |
Process multimodal inputs for batching. | #L96-L186 |
MultimodalProcessor.process_for_request |
method | MultimodalProcessor.process_for_request(prompt: str, images: Optional[List[str]] = None, videos: Optional[List[str]] = None, **kwargs) -> Dict[str, Any] |
Process inputs and return a dict suitable for Request fields. | #L188-L224 |
MultimodalProcessor.batch_pixel_values |
method | MultimodalProcessor.batch_pixel_values(pixel_values_list: List[Optional[mx.array]]) -> Optional[mx.array] |
Batch multiple pixel_values tensors together. | #L226-L255 |
MultimodalProcessor.batch_image_grid_thw |
method | MultimodalProcessor.batch_image_grid_thw(grid_thw_list: List[Optional[mx.array]]) -> Optional[mx.array] |
Batch multiple image_grid_thw tensors together. | #L257-L279 |
MultimodalProcessor.prepare_for_batch |
method | MultimodalProcessor.prepare_for_batch(processed_inputs: List[ProcessedMultimodalInput]) -> Tuple[mx.array, Dict[str, Any], List[int]] |
Prepare multiple processed inputs for batch generation. | #L281-L366 |
MultimodalProcessor.extract_vision_embeddings |
method | MultimodalProcessor.extract_vision_embeddings(pixel_values: mx.array, image_grid_thw: Optional[mx.array] = None) -> mx.array |
Extract vision embeddings from pixel values. | #L368-L409 |
MultimodalProcessor.compute_vision_hash |
method | MultimodalProcessor.compute_vision_hash(pixel_values: mx.array) -> str |
Compute a hash for pixel values for caching purposes. | #L411-L431 |