Computer Vision
Vision-Language Model (VLM)
Cosa significa «Vision-Language Model (VLM)»?
Modello che elabora congiuntamente immagini e testo in uno spazio di rappresentazione comune, abilitando compiti come descrizione di immagini, risposta a domande visive e ricerca cross-modale. Apprende le associazioni fra contenuti visivi e linguaggio da grandi corpora accoppiati.