PofoliaPofolia ile paylaşıldı

arXiv (Cornell University)· 2020· Ön baskı

Bir Görüntü 16x16 Kelimeye Bedeldir: Ölçekte Görüntü Tanıma için Transformerlar

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn ve diğerleri

Kısa özet

Görüntü yamaları dizilerine doğrudan uygulanan saf bir Transformer mimarisi olan Vision Transformer (ViT), eğitim için daha az hesaplama kaynağıyla görüntü sınıflandırmada en gelişmiş sonuçları elde eder.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

ÇıkarımlarUygulamada
Ana noktalarUygulamada
Makaleye SorUygulamada

Devamı Pofolia uygulamasında

Çıkarımlar, ana noktalar ve makaleye soru sorma; ilgi alanına göre her gün yeni özetler. Ücretsiz.

Web'de giriş yaparak aç

Alan: Bilgisayarlı Görü ve Örüntü Tanıma

Computer Vision and Pattern RecognitionComputer Science