ACM Transactions on Architecture and Code Optimization· 2026Q2
EcoMLC: Önbellek Yeniden Kullanımı ve Frekans Ölçekleme Yoluyla Enerji Verimli Makine Öğrenmesi Derleme Çerçevesi
EcoMLC: An Energy-Efficient Machine Learning Compilation Framework via Cache Reuse and Frequency Scaling
- 0atıf
- Q2SCImago
- 2026yıl
Kısa özet
EcoMLC, yeni bir makine öğrenmesi derleme çerçevesi, önbellek yeniden kullanımını ve frekans ölçeklemeyi optimize ederek TensorRT ve vLLM'ye kıyasla ortalama %43 enerji tasarrufu sağlıyor.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Ana noktalar
- EcoMLC çerçevesi, önbellek takılmalarını azaltmak için ters zamanlama politikası ve açık önbellek önceliği sunar.
- Optimum enerji çalışma noktaları için uçtan uca frekans tarama analizi kullanır.
- NVIDIA GPU'larda TensorRT ve vLLM'ye kıyasla ortalama %43 enerji tasarrufu (J/istek) sağlar.
- NVIDIA GPU'larda TensorRT ve vLLM'ye kıyasla ortalama %26 enerji tasarrufu (J/jeton) sağlar.
- LLM'ler için %7 performans düşüşü karşılığında %33,9 enerji tüketimi azaltımı gösterir.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Özet (abstract)
While modern machine learning compilers (MLCs) are pushing deep neural network (DNN) inference latency to its theoretical limits, the accompanying energy overhead has become a critical bottleneck for large-scale deployment. Excessive energy consumption not only increases electricity costs, but also affects the sustainability of edge platforms. Traditional performance-first optimizations often lead to significant energy waste, as they overlook the complex interplay between kernel configurations, cache behaviors and frequency scaling. This paper presents EcoMLC, an energy-efficient machine learning compilation framework. EcoMLC introduces a reverse scheduling policy combined with an explicit cache priority mechanism, mitigating cache thrashing inherent in standard least recently used (LRU) policies. EcoMLC employs an end-to-end frequency-sweeping analysis to identify optimal energy operating points and enables fine-grained trade-offs between performance and energy under diverse service level objective (SLO) constraints. Experimental results demonstrate that EcoMLC effectively optimizes various workloads, achieving an average of 43% and 26% energy savings (in J/request and J/token) over NVIDIA’s TensorRT and vLLM, and 22% energy savings on an AMD GPU compared to vLLM. For certain large language model (LLM) configurations, EcoMLC achieves a 33.9% reduction in energy consumption at the cost of a marginal 7% decline in performance.
Yazarların özeti; kaynağından alınmıştır. ACM Transactions on Architecture and Code Optimization, 2026 · DOI ↗
Ücretsiz hesapla devam et
Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.
Web'de ücretsiz devam etGoogle ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.
Telefonda:
Alan: Donanım ve Mimari
Hardware and ArchitectureComputer Science