arXiv (Cornell University)· 2020· Ön baskı
Bir Görüntü 16x16 Kelimeye Bedeldir: Ölçekte Görüntü Tanıma için Transformerlar
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- 21.699atıf
- 2020yıl
Kısa özet
Görüntü yamaları dizilerine doğrudan uygulanan saf bir Transformer mimarisi olan Vision Transformer (ViT), eğitim için daha az hesaplama kaynağıyla görüntü sınıflandırmada en gelişmiş sonuçları elde eder.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Devamı Pofolia uygulamasında
Çıkarımlar, ana noktalar ve makaleye soru sorma; ilgi alanına göre her gün yeni özetler. Ücretsiz.
Web'de giriş yaparak açAlan: Bilgisayarlı Görü ve Örüntü Tanıma
Computer Vision and Pattern RecognitionComputer Science