Post

Feature Pyramid Network

SSD (Single Shot MultiBox Detector) - Object Detection Feature Pyramid Network (FPN): Migliorare l'Object Detection su Oggetti di Diverse Dimensioni Le Feature Pyramid Networks (FPN) sono una tecnica usata nei modelli di object detection per migliorare il riconoscimento di oggetti di diverse dimensioni. Sono state introdotte da Lin et al. nel 2017 e sono utilizzate in modelli avanzati come RetinaNet , Faster R-CNN e YOLO . 1. Perché servono le Feature Pyramid Networks? Nei modelli di computer vision , le reti neurali convoluzionali ( CNN ) elaborano un'immagine attraverso più strati, creando feature map a diverse risoluzioni. 💡 Problema: Gli oggetti piccoli possono perdersi negli strati più profondi della rete, dove la risoluzione è più bassa. Gli oggetti grandi possono non essere ben rappresentati negli strati più superficiali. ✅ Soluzione: La FPN combina feature map a diverse scale , permettendo alla rete di riconos...

RetinaNET

SSD (Single Shot MultiBox Detector) - Object Detection RetinaNet: Un Modello One-Stage per l'Object Detection RetinaNet è un'architettura per il riconoscimento di oggetti introdotta da Facebook AI Research (FAIR) nel 2017. Il modello ha rivoluzionato l'object detection one-stage , superando le prestazioni dei modelli two-stage come Faster R-CNN grazie all'uso della Focal Loss . 1. Perché RetinaNet? Nei modelli di rilevazione di oggetti, esistono due principali approcci: Two-stage (Faster R-CNN) → Genera regioni candidate ( Region Proposal Network, RPN ), poi le classifica. Accurato ma lento. One-stage (SSD, YOLO) → Predice direttamente classi e bounding box. Molto veloce ma meno accurato. 🔥 Problema: I modelli one-stage soffrono lo sbilanciamento tra classi positive (oggetti) e negative (sfondo) , portando la rete a ignorare gli esempi difficili. ✅ Soluzione di RetinaNet: la Focal Loss , che bilancia meglio gli esempi faci...

Smooth L1 Loss

SSD (Single Shot MultiBox Detector) - Object Detection Smooth L1 Loss: Una Funzione di Perdita per la Regressione dei Bounding Box La Smooth L1 Loss è una funzione di perdita comunemente usata in object detection per la regressione delle coordinate dei bounding box. È stata introdotta in Fast R-CNN (2015) per stabilizzare il training rispetto alla classica L1 Loss (MAE, Mean Absolute Error) e alla L2 Loss (MSE, Mean Squared Error). 1. Formula della Smooth L1 Loss La funzione è definita come: SmoothL1(x) = 0.5x² se |x| < δ δ (|x| - 0.5δ) altrimenti Dove: x = y_pred - y_true è l'errore tra il valore predetto e quello reale. δ è un parametro che controlla la transizione tra la perdita quadratica e lineare (tipicamente δ = 1 ). 2. Perché usare la Smooth L1 Loss? Confronto con L1 Loss e L2 Loss L1 Loss (|x|) → Resistente agli outlier, ma non è derivabile in 0 (non smooth). L2 Loss (x²) → Penalizza troppo gli...

La Focal Loss

SSD (Single Shot MultiBox Detector) - Object Detection Focal Loss: Cos'è e Come Funziona La Focal Loss è una funzione di perdita introdotta per migliorare la performance di modelli di object detection come RetinaNet . Il suo scopo principale è ridurre l'impatto degli esempi facili e dare più importanza agli esempi difficili. 🔹 Problema che risolve Nei dataset di object detection, il numero di oggetti è molto inferiore rispetto allo sfondo. Questo crea uno sbilanciamento che rende il modello meno efficace nel riconoscere gli oggetti rari o piccoli. La Focal Loss aiuta a risolvere questo problema modificando la Cross-Entropy Loss con un fattore di focalizzazione . 🔹 Formula della Focal Loss La formula della Focal Loss è: FL(p_t) = - α (1 - p_t) ^ γ log(p_t) p_t : probabilità predetta della classe corretta. α : bilancia il peso tra cla...