Post

Visualizzazione dei post con l'etichetta ARCHITETTURE TIPO VIT

Swin Transformer: Vision Transformer con Shifted Windows

Immagine
Swin Transformer: Vision Transformer con Shifted Windows 🧠 Swin Transformer: Vision Transformer con Shifted Windows Il Swin Transformer è una variante avanzata dei Vision Transformer (ViT) che introduce il concetto di Shifted Window per migliorare l'efficienza e la scalabilità dell'attenzione sui pixel di un'immagine. Definito in questo paper 2103.14030 📌 Caratteristiche Principali ✅ **Hierarchical Feature Map** per una rappresentazione più ricca e gerarchica dell'immagine. ✅ **Window Attention** per ridurre la complessità computazionale dell'attenzione. ✅ **Shifted Windows** per migliorare la connessione tra regioni locali e globali dell'immagine. ⚡ Hierarchical Feature Map Il Swin Transformer suddivide l'immagine in livelli gerarchici, permettendo di catturare meglio sia le caratteristiche di basso livello che quelle di alto livello. ...

Reti DeiT: Data-efficient Image Transformer

DeiT: Data-efficient Image Transformer 🧠 DeiT: Data-efficient Image Transformer Le DeiT (Data-efficient Image Transformer) sono una variante ottimizzata dei Vision Transformer ( ViT ), progettata per migliorare l'efficienza e ridurre la dipendenza dai dataset di grandi dimensioni. 📌 Caratteristiche Principali ✅ **Miglioramento dell'efficienza dei ViT** senza necessità di enormi dataset di addestramento. ✅ **Distillation Token**, un meccanismo per migliorare le prestazioni usando un insegnante CNN. ✅ **Migliore generalizzazione** con meno dati rispetto ai tradizionali Vision Transformer. ⚡ Distillation Token Il Distillation Token è una nuova componente che aiuta DeiT a imparare da una rete insegnante basata su CNN , migliorando l'accuratezza e riducendo i requisiti di dati. 🔄 Confronto con ViT Rispetto ai **ViT tradizionali**, DeiT introduce ...