PofoliaPofolia ile paylaşıldı

ACM Transactions on Architecture and Code Optimization· 2026Q2

EcoMLC: Önbellek Yeniden Kullanımı ve Frekans Ölçekleme Yoluyla Enerji Verimli Makine Öğrenmesi Derleme Çerçevesi

EcoMLC: An Energy-Efficient Machine Learning Compilation Framework via Cache Reuse and Frequency Scaling

Chaoyang Gu, Zhanyuan Di, Leping Wang, Dingwen Tao ve diğerleri

Kısa özet

EcoMLC, yeni bir makine öğrenmesi derleme çerçevesi, önbellek yeniden kullanımını ve frekans ölçeklemeyi optimize ederek TensorRT ve vLLM'ye kıyasla ortalama %43 enerji tasarrufu sağlıyor.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Ana noktalar

  • EcoMLC çerçevesi, önbellek takılmalarını azaltmak için ters zamanlama politikası ve açık önbellek önceliği sunar.
  • Optimum enerji çalışma noktaları için uçtan uca frekans tarama analizi kullanır.
  • NVIDIA GPU'larda TensorRT ve vLLM'ye kıyasla ortalama %43 enerji tasarrufu (J/istek) sağlar.
  • NVIDIA GPU'larda TensorRT ve vLLM'ye kıyasla ortalama %26 enerji tasarrufu (J/jeton) sağlar.
  • LLM'ler için %7 performans düşüşü karşılığında %33,9 enerji tüketimi azaltımı gösterir.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Özet (abstract)

While modern machine learning compilers (MLCs) are pushing deep neural network (DNN) inference latency to its theoretical limits, the accompanying energy overhead has become a critical bottleneck for large-scale deployment. Excessive energy consumption not only increases electricity costs, but also affects the sustainability of edge platforms. Traditional performance-first optimizations often lead to significant energy waste, as they overlook the complex interplay between kernel configurations, cache behaviors and frequency scaling. This paper presents EcoMLC, an energy-efficient machine learning compilation framework. EcoMLC introduces a reverse scheduling policy combined with an explicit cache priority mechanism, mitigating cache thrashing inherent in standard least recently used (LRU) policies. EcoMLC employs an end-to-end frequency-sweeping analysis to identify optimal energy operating points and enables fine-grained trade-offs between performance and energy under diverse service level objective (SLO) constraints. Experimental results demonstrate that EcoMLC effectively optimizes various workloads, achieving an average of 43% and 26% energy savings (in J/request and J/token) over NVIDIA’s TensorRT and vLLM, and 22% energy savings on an AMD GPU compared to vLLM. For certain large language model (LLM) configurations, EcoMLC achieves a 33.9% reduction in energy consumption at the cost of a marginal 7% decline in performance.

Yazarların özeti; kaynağından alınmıştır. ACM Transactions on Architecture and Code Optimization, 2026 · DOI ↗

ÇıkarımlarPremium
Makaleye SorÜcretsiz hesapla

Ücretsiz hesapla devam et

Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.

Web'de ücretsiz devam et

Google ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.

Telefonda:

Alan: Donanım ve Mimari

Hardware and ArchitectureComputer Science