Vision-Language Model (VLM)
Verificato
Significato di «Vision-Language Model (VLM)»
Modello che elabora congiuntamente immagini e testo in uno spazio di rappresentazione comune, abilitando compiti come descrizione di immagini, risposta a domande visive e ricerca cross-modale. Apprende le associazioni fra contenuti visivi e linguaggio da grandi corpora accoppiati.
Fonti: VLM: allineamento immagine-testo in spazio comune. Fonti: Radford et al. "CLIP" (ICML 2021, arXiv:2103.00020); Alayrac et al. "Flamingo" (NeurIPS 2022, arXiv:2204.14198). verifica web 2026-08-03 · Verificato il 2026-08-03