Vision Transformer
Verificato
Aggiornato il 14/08/2026
Significato di «Vision Transformer»
Trasformer per immagini (ViT). Architettura che divide l'immagine in patch di dimensione fissa, le proietta in embedding e le elabora come una sequenza tramite l'auto-attenzione, senza convoluzioni.
Fonti: ViT: patch embedding + self-attention, senza convoluzioni. Fonti: Dosovitskiy et al. "An Image is Worth 16x16 Words" (ICLR 2021, arXiv:2010.11929); Szeliski 2nd ed. verifica web 2026-08-03 · Verificato il 2026-08-03
Domande frequenti su Vision Transformer
Cosa significa «Vision Transformer»?
Trasformer per immagini (ViT). Architettura che divide l'immagine in patch di dimensione fissa, le proietta in embedding e le elabora come una sequenza tramite l'auto-attenzione, senza convoluzioni.
A quale glossario appartiene «Vision Transformer»?
«Vision Transformer» fa parte del glossario Computer Vision, nella categoria Intelligenza Artificiale di Glossario Italiano.