LGAIJun 24

EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression

arXiv:2606.252859.2Has Code
Predicted impact top 45% in LG · last 90 daysOriginality Incremental advance
AI Analysis

This work addresses the inflexibility of existing post-training sparsity methods that require separate optimization for each sparsity level, enabling efficient deployment of LLMs across diverse hardware scenarios.

EPTS introduces a multi-sparsity framework that produces a single elastic model capable of maintaining robust performance across diverse sparsity configurations via one-shot optimization, achieving competitive performance with SparseGPT and Wanda while enabling efficient multi-scenario deployment.

Post-Training Sparsity (PTS) has emerged as a crucial paradigm for compressing Large Language Models to facilitate efficient deployment on resource-constrained devices. However, existing PTS methodologies are typically confined to Single-Sparsity optimization, necessitating a separate, time-consuming optimization session for each specific sparsity level. This rigid paradigm significantly hinders flexible deployment across diverse hardware scenarios, as adapting to a new sparsity requirement mandates a complete re-optimization process. To address these limitations, we propose Elastic Post-Training Sparsity (EPTS), a unified Multi-Sparsity framework that produces a single elastic model capable of maintaining robust performance across diverse sparsity configurations through a one-shot optimization process. Specifically, we design a Multi-Sparsity Hierarchy LoRA (MS-HiLoRA) mechanism that facilitates knowledge inheritance from low- to high-sparsity groups, effectively mitigating the competition for parameter reconstruction. Furthermore, we introduce a Multi-Sparsity Feature Mixer (MSFM), which significantly enhances the model's adaptability to pruning perturbations by dynamically fusing feature representations of varying sparsity granularities. Extensive experiments on LLaMA and OPT families demonstrate that EPTS achieves competitive performance compared to state-of-the-art methods like SparseGPT and Wanda, while offering significant efficiency gains by enabling multi-scenario deployment from a single optimization. our source code is available at https://github.com/xuke225/EPTS.

Code Implementations1 repo
Foundations

The foundational work for this paper's niche, ranked by how specifically the neighbourhood builds on it — not by global fame.

Your Notes