BGEMM-CUDA is a CUDA-based low-bit GEMM kernel library for efficient neural network inference. It implements optimized binary and ternary matrix multiplication primitives, including binary-weight and ternary-activation computation, with PyTorch extension support for model-level integration.
cuda high-performance-computing cuda-kernels gemm binarization low-bit-quantization bgemm lowbit-kernel
-
Updated
Aug 30, 2024 - Cuda