vLLM-Omni is currently working on production VAE optimization for MiniMax-H3 in
vllm-project/vllm-omni#5948
As a follow-up, would the ModelOpt team be interested in adding quantization support for the MiniMax-H3 Visual VAE?
This could explore FP8, NVFP4, or mixed-precision quantization depending on quality and kernel support, and potentially integrate with the VAE optimization path in vLLM-Omni.
Thanks!
vLLM-Omni is currently working on production VAE optimization for MiniMax-H3 in
vllm-project/vllm-omni#5948
As a follow-up, would the ModelOpt team be interested in adding quantization support for the MiniMax-H3 Visual VAE?
This could explore FP8, NVFP4, or mixed-precision quantization depending on quality and kernel support, and potentially integrate with the VAE optimization path in vLLM-Omni.
Thanks!