Tag: model pruning

Combining Pruning and Quantization for Maximum LLM Speedups
Combining Pruning and Quantization for Maximum LLM Speedups

Tamara Weed, Sep, 5 2026

Discover how combining pruning and quantization boosts LLM speed. Learn about HWPQ, 2:4 sparsity, and practical tips for maximizing model efficiency without losing accuracy.

Categories:

Energy Efficiency in Generative AI Training: Sparsity, Pruning, and Low-Rank Methods
Energy Efficiency in Generative AI Training: Sparsity, Pruning, and Low-Rank Methods

Tamara Weed, Apr, 17 2026

Learn how to reduce Generative AI training energy by 30-80% using sparsity, pruning, and low-rank methods. A practical guide to sustainable AI development.

Categories: