Glossario NLP e LLM
Il linguaggio naturale per le macchine: NLP, modelli linguistici, token e prompt. I termini di LLM e AI generativa spiegati semplice.
-
A
-
Adapter
Piccolo modulo di parametri inserito tra gli strati di un modello pre-addestrato e addestrato mantenendo congelati i pesi originali. Consente il fine-tuning efficiente (PEFT) su un compito specifico modificando pochi parametri, riducendo memoria e costo rispetto all'aggiornamento dell'intera rete neurale. -
ALiBi
Attention with Linear Biases, metodo di Press, Smith e Lewis (2021): invece di aggiungere embedding posizionali, aggiunge ai punteggi di attenzione query-key una penalità lineare crescente con la distanza tra i token. Consente ai Transformer di estrapolare a sequenze più lunghe di quelle viste in addestramento. -
Analisi lessicale
Prima fase dell'elaborazione di un testo o di un programma, in cui la sequenza di caratteri viene suddivisa in unità elementari dette token (parole, numeri, simboli). Nei compilatori la svolge il lexer o scanner; nel NLP corrisponde alla tokenizzazione che precede l'analisi sintattica e semantica. -
Analisi morfologica
Studio della struttura interna delle parole, scomposte nei morfemi minimi (radice, prefissi, suffissi, desinenze) per determinarne il lemma e tratti grammaticali come genere, numero, tempo e persona. In NLP è svolta da analizzatori morfologici e da tecniche di stemming o lemmatizzazione, e costituisce la base per compiti a valle come il POS tagging. -
Attention mask
Maschera usata nel meccanismo di attenzione dei Transformer per impedire a un token di considerare determinate posizioni, azzerandone di fatto il peso. Serve a ignorare i token di riempimento (padding) e, nei modelli causali come i GPT, a nascondere i token futuri, così che ogni posizione veda solo il contesto precedente. -
Attention weights
Coefficienti calcolati dal meccanismo di attenzione che quantificano quanto ogni token influenza la rappresentazione di un altro. Derivano dal prodotto scalare tra query e key, riscalato e normalizzato con softmax così da sommare a uno, e pesano i vettori value. Sono il cuore dei Transformer. -
B
-
Backtranslation
Tecnica di traduzione automatica e di data augmentation che traduce un testo in una lingua intermedia e poi di nuovo in quella originale, generando varianti parafrasate. In traduzione neurale (Sennrich et al., 2016) serve a creare dati paralleli sintetici da testi monolingui, migliorando il modello. -
Bag of Words
Rappresentazione testuale che descrive un documento come l'insieme non ordinato delle parole che contiene, tipicamente tramite conteggi o frequenze, ignorando ordine e sintassi. Semplice ed efficace per la classificazione, è spesso pesata con TF-IDF, ma resta priva di informazione contestuale. -
BART
BART (Bidirectional and Auto-Regressive Transformers), presentato da Lewis et al. (Facebook AI, 2019), e un modello seq2seq preaddestrato come autoencoder denoising: corrompe il testo con funzioni di rumore, ad esempio mascherando span e permutando frasi, e impara a ricostruirlo. Eccelle in generazione e sintesi. -
Batch dinamico
Strategia che raggruppa in uno stesso lotto sequenze di lunghezza simile, così da minimizzare il padding necessario per uniformarle. Riduce il calcolo sprecato sui token di riempimento e aumenta l'efficienza dell'addestramento e dell'inferenza nei modelli che elaborano testo a lunghezza variabile. -
Beam search
Algoritmo di decodifica che, generando una sequenza, mantiene a ogni passo le k ipotesi parziali più probabili (la beam width) anziché la sola migliore, espandendole e riordinandole. Approssima la ricerca della sequenza globalmente più probabile, offrendo un compromesso tra la greedy search e l'esplorazione esaustiva. -
Benchmark linguistico
Insieme standardizzato di dataset e compiti usato per misurare e confrontare in modo oggettivo le prestazioni dei modelli linguistici. Definisce dati di test e metriche condivise; esempi noti sono GLUE, SuperGLUE e MMLU. Consente classifiche comparabili ma può essere soggetto a contaminazione dei dati. -
BERT
Modello linguistico basato su encoder Transformer bidirezionale, introdotto da Devlin et al. (Google, 2018). Pre-addestrato su grandi corpora con gli obiettivi Masked Language Modeling e Next Sentence Prediction, apprende rappresentazioni contestuali leggendo simultaneamente il contesto a sinistra e a destra e si adatta a compiti a valle tramite fine-tuning. -
BERTScore
Metrica di valutazione per la generazione di testo proposta da Zhang e colleghi nel 2019. Anziché confrontare n-grammi esatti come BLEU o ROUGE, allinea i token di candidato e riferimento tramite similarità coseno tra gli embedding contestuali di BERT, e ne calcola precision, recall e F1. Coglie l'equivalenza di senso. -
Bi-encoder
Architettura in cui query e documenti sono codificati separatamente in vettori da encoder che non interagiscono tra loro. I confronti avvengono con misure come il coseno, così da pre-calcolare e indicizzare i vettori per ricerche semantiche veloci su larga scala, a differenza del cross-encoder più preciso ma lento. -
Bias linguistico
Distorsione sistematica per cui un modello linguistico riproduce o amplifica pregiudizi presenti nei dati di addestramento, ad esempio stereotipi di genere, etnia o cultura. Può generare output iniqui o discriminatori e richiede apposite tecniche di misurazione e mitigazione. -
BLEU
BLEU (Bilingual Evaluation Understudy), proposto da Papineni et al. nel 2002, e una metrica automatica per la traduzione automatica che confronta l'output con una o più traduzioni di riferimento misurando la precisione degli n-grammi. Include una penalita di brevita e restituisce un punteggio tra 0 e 1 (o 0-100). -
Byte Pair Encoding (BPE)
Algoritmo di tokenizzazione a subword nato come metodo di compressione (Gage, 1994) e applicato all'NLP da Sennrich et al. (2016). Parte dai singoli caratteri e fonde iterativamente la coppia di simboli più frequente, costruendo un vocabolario che rappresenta le parole rare o sconosciute scomponendole in unità note. -
C
-
Calibrazione
Proprietà per cui le probabilità stimate da un modello riflettono le reali frequenze di correttezza: tra le predizioni date con confidenza 0.8, circa l'80% dovrebbe risultare corretto. Si misura con l'Expected Calibration Error e si corregge con tecniche come il temperature scaling o la Platt scaling. -
Catastrophic forgetting
Fenomeno per cui una rete neurale, addestrata su un nuovo compito o nuovi dati, perde bruscamente le competenze acquisite in precedenza, perché l'aggiornamento dei pesi sovrascrive quanto appreso. E un ostacolo del continual learning, mitigato con tecniche come replay dei dati e regolarizzazione (EWC). -
Causal masking
Vincolo applicato al meccanismo di attenzione nei modelli generativi (decoder Transformer) che impedisce a ogni token di considerare quelli successivi, mascherando le posizioni future prima della softmax. Garantisce l'autoregressività: la previsione di un token dipende solo dai token precedenti, coerentemente con la generazione da sinistra a destra. -
CBOW
Continuous Bag-of-Words, una delle due architetture di Word2Vec introdotte da Mikolov e colleghi nel 2013. Predice la parola centrale a partire dai token del contesto circostante, di cui media le rappresentazioni ignorandone l'ordine. Rispetto allo skip-gram e più veloce e rende bene sulle parole frequenti. -
Chain-of-Verification
Strategia in cui il modello, dopo una prima risposta, genera domande di verifica, vi risponde in modo indipendente e infine rivede la risposta iniziale alla luce di tali controlli. Riduce le allucinazioni introducendo un passo esplicito di auto-verifica. -
Character Error Rate (CER)
Metrica che valuta la qualità di una trascrizione o di un OCR contando inserimenti, cancellazioni e sostituzioni di caratteri rispetto al testo di riferimento, divisi per il numero di caratteri del riferimento. E la variante del WER calcolata sui singoli caratteri, utile per lingue senza spazi netti tra le parole. -
Chunking
In NLP, analisi sintattica superficiale che raggruppa parole adiacenti in unità non sovrapposte, come sintagmi nominali o verbali, senza costruire un albero sintattico completo. Si colloca tra il POS tagging e il parsing e serve a estrarre entità e frasi rilevanti dal testo. -
Code-switching
Fenomeno linguistico per cui un parlante alterna due o più lingue o varieta all'interno della stessa conversazione, frase o parola. Comune nelle comunita bilingui, segue regole grammaticali proprie e rappresenta una sfida per l'NLP, che deve gestire testi con lingue miste in tokenizzazione, riconoscimento e traduzione. -
Constituency parsing
Analisi sintattica che scompone una frase in costituenti annidati, cioè sintagmi come quello nominale o verbale, secondo una grammatica a struttura sintagmatica. Produce un albero le cui foglie sono le parole e i nodi interni i sintagmi; si contrappone al dependency parsing, basato sulle relazioni tra parole. -
Constrained decoding
Tecnica di generazione che vincola l'output di un modello linguistico a rispettare una struttura predefinita, come uno schema JSON, un'espressione regolare o una grammatica formale, azzerando la probabilità dei token che violerebbero il vincolo. Garantisce risposte valide, utile per le chiamate a strumenti. -
Context Caching
Ottimizzazione che memorizza gli stati interni calcolati per una porzione di prompt riutilizzata frequentemente, così da non ricomputarla a ogni richiesta. Riduce latenza e costo quando molte chiamate condividono un lungo prefisso comune, come istruzioni di sistema o documenti. -
Context length extension
Insieme di tecniche che permettono a un modello linguistico di elaborare sequenze più lunghe della finestra di contesto vista in addestramento. Spesso agiscono sulle codifiche posizionali, riscalando o interpolando le posizioni (RoPE scaling, YaRN), per aumentare i token gestibili senza riaddestrare da zero. -
Contrastive decoding
Tecnica di generazione che migliora la qualità del testo contrapponendo le predizioni di un modello esperto grande e uno amateur piccolo, scegliendo i token che massimizzano la differenza delle loro log-probabilità. Proposta da Li et al. (2022), riduce ripetizioni e incoerenze isolando la competenza dell'esperto, senza richiedere ulteriore addestramento. -
Contrastive learning testuale
Paradigma di apprendimento che struttura lo spazio delle rappresentazioni avvicinando coppie di testi semanticamente simili (positivi) e allontanando quelli dissimili (negativi), tipicamente con perdite come InfoNCE. Applicato a frasi produce embedding utili per ricerca semantica; SimCSE ne e un esempio noto. -
Coreference resolution
Compito del NLP che consiste nell'individuare tutte le espressioni di un testo che si riferiscono alla stessa entità, come un nome proprio e i pronomi che lo richiamano. Raggruppa tali menzioni in catene di coreferenza ed e essenziale per comprensione del testo, estrazione di informazioni e question answering. -
Cross-attention
Meccanismo di attenzione in cui le query provengono da una sequenza mentre chiavi e valori provengono da un'altra, permettendo a un modulo di attendere rappresentazioni esterne. Nei Transformer encoder-decoder collega il decoder all'output dell'encoder ed è usato anche nei modelli multimodali. -
Cross-encoder
Architettura per il confronto di testi che elabora due input, ad esempio query e documento, concatenati in un unico passaggio del Transformer, modellandone pienamente l'interazione con self-attention. Fornisce punteggi di rilevanza molto accurati ma costosi, quindi si usa tipicamente per riordinare pochi candidati. -
Curriculum learning
Strategia di addestramento, formalizzata da Bengio et al. (2009), che presenta al modello gli esempi in ordine di difficoltà crescente, dal più semplice al più complesso. Ispirata all'apprendimento umano, mira ad accelerare la convergenza e a migliorare la generalizzazione del modello finale. -
D
-
Data contamination
Fenomeno per cui esempi del set di test o dei benchmark di valutazione compaiono anche nei dati di addestramento del modello, spesso per via dello scraping del web. Ne risulta una sovrastima delle prestazioni, perché il modello ha memorizzato le risposte invece di generalizzare; si mitiga con la decontaminazione. -
Decoder
Nell'architettura Transformer, componente che genera la sequenza di output un token alla volta in modo autoregressivo, basandosi sui token già prodotti e, nei modelli encoder-decoder, sulle rappresentazioni dell'input. Usa self-attention mascherata per non guardare il futuro; i modelli GPT sono decoder-only. -
Dense retrieval
Paradigma di recupero dell'informazione che rappresenta query e documenti come vettori densi (embedding) prodotti da encoder neurali e ne misura la similarità, tipicamente col prodotto interno, tramite ricerca vettoriale approssimata come FAISS. Coglie la vicinanza semantica oltre le parole chiave esatte; esempio noto è DPR (Karpukhin et al., 2020). -
Dependency parsing
Analisi delle dipendenze: tecnica di parsing sintattico che individua i legami grammaticali diretti tra le parole di una frase, collegando ogni termine a una testa (head) e costruendo un albero di relazioni etichettate come soggetto, oggetto o modificatore. -
Detokenizzazione
Detokenizzazione: processo inverso della tokenizzazione che riassembla una sequenza di token in una stringa di testo leggibile, ripristinando spazi, punteggiatura e maiuscole secondo le regole del tokenizzatore utilizzato. -
Direct Preference Optimization
Direct Preference Optimization (DPO): metodo di allineamento che ottimizza direttamente un modello linguistico sulle preferenze umane, a partire da coppie di risposte preferita e rifiutata, senza addestrare un modello di ricompensa separato né usare reinforcement learning come nell'RLHF. -
Distillazione della conoscenza
Distillazione della conoscenza: tecnica di compressione in cui un modello piccolo (studente) viene addestrato a imitare le uscite di uno più grande (insegnante), apprendendo dalle sue distribuzioni di probabilità per ottenere prestazioni simili con meno risorse. -
Document chunking
Document chunking: suddivisione di testi lunghi in frammenti più piccoli (chunk) di dimensione gestibile, spesso con parziale sovrapposizione, per consentire indicizzazione e recupero efficienti nei sistemi di retrieval e nelle pipeline RAG. -
E
-
ELECTRA
ELECTRA: modello encoder pre-addestrato con il compito di replaced token detection, in cui un generatore sostituisce alcuni token e il modello impara a distinguere quelli reali da quelli sostituiti; applicando la supervisione a tutti i token risulta più efficiente del masked language modeling. -
ELMo
ELMo (Embeddings from Language Models): rappresentazioni di parole contestuali che variano in base alla frase, ottenute combinando gli stati interni di una rete ricorrente biLSTM profonda pre-addestrata come modello linguistico. -
Embedding semantico
Embedding semantico: rappresentazione numerica di un testo come vettore in uno spazio multidimensionale, costruita in modo che testi con significato simile risultino vicini, permettendo di misurarne la similarità tramite distanze o coseno. -
Encoder
Encoder: componente di una rete neurale che trasforma una sequenza di input in una rappresentazione interna densa e ricca di contesto; nei transformer usa l'attenzione bidirezionale per codificare ogni token tenendo conto dell'intera sequenza. -
Exact Match
Exact Match (EM): metrica di valutazione binaria che assegna punteggio pieno solo quando la risposta generata coincide esattamente con quella di riferimento, in genere dopo una normalizzazione di spazi, punteggiatura e maiuscole. -
F
-
F1 a livello di token
F1 a livello di token: metrica che tratta risposta e riferimento come insiemi di token e calcola la media armonica tra precisione e richiamo sui token condivisi, premiando le sovrapposizioni parziali; è usata per esempio nel benchmark SQuAD. -
Faithfulness
Faithfulness (fedeltà): nella valutazione dei sistemi RAG, grado in cui una risposta generata resta ancorata alle fonti fornite, senza aggiungere affermazioni non supportate dal contesto o inventate (allucinazioni). -
FastText
FastText: libreria e modello di word embedding di Facebook AI che estende Word2Vec rappresentando ogni parola come somma dei vettori dei suoi n-grammi di caratteri; questo consente di gestire parole rare e fuori vocabolario sfruttando la morfologia. -
Feed-forward network
Feed-forward network: sottostrato di un blocco transformer costituito da una rete pienamente connessa applicata in modo indipendente a ogni posizione della sequenza, tipicamente due trasformazioni lineari con una non linearità interposta. -
Flash attention
Flash attention: implementazione esatta e IO-aware dell'attenzione che, tramite tiling e fusione delle operazioni, riduce gli accessi alla memoria ad alta larghezza di banda della GPU, accelerando il calcolo e abbassando l'uso di memoria sulle sequenze lunghe. -
Function calling
Function calling: capacità di un modello linguistico di produrre, in risposta a una richiesta, l'invocazione strutturata (in genere in formato JSON) di uno strumento o funzione esterna, con nome e argomenti, per interagire con sistemi e dati esterni. -
G
-
GloVe
GloVe (Global Vectors): modello di word embedding non supervisionato che costruisce i vettori di parola a partire dalle statistiche globali di co-occorrenza in un corpus, fattorizzando la matrice dei conteggi per catturare relazioni semantiche. -
GPT-2
GPT-2: modello linguistico decoder-only basato su transformer rilasciato da OpenAI nel 2019 e addestrato a predire il token successivo; ha mostrato la capacità di generare testo coerente su larga scala e buone prestazioni zero-shot su vari compiti. -
Gradient accumulation
Gradient accumulation: tecnica di addestramento che somma i gradienti calcolati su più mini-batch consecutivi prima di aggiornare i pesi, simulando un batch di dimensione maggiore senza superare i limiti di memoria della GPU. -
Greedy decoding
Greedy decoding: strategia di generazione che a ogni passo seleziona in modo deterministico il token con probabilità più alta, senza esplorare alternative; è veloce ma può produrre testi ripetitivi o subottimali rispetto a beam search o campionamento. -
Grouped-query attention
Grouped-query attention (GQA): variante dell'attenzione multi-testa in cui gruppi di teste di query condividono le stesse teste di chiave e valore; riduce la dimensione della cache KV e la banda di memoria in inferenza, con qualità vicina all'attenzione multi-testa completa. -
H
-
Hybrid search
Hybrid search (ricerca ibrida): approccio di recupero che combina la ricerca densa basata su embedding vettoriali con quella sparsa basata su termini (come BM25), fondendo i risultati per unire comprensione semantica e corrispondenza lessicale esatta. -
HyDE
HyDE (Hypothetical Document Embeddings): tecnica di recupero in cui un LLM genera un documento ipotetico che risponde alla query, il cui embedding serve a cercare nell'indice; il testo fittizio, pur impreciso nei dettagli, migliora il recupero dei documenti rilevanti. -
J
-
Jailbreak
Jailbreak: tecnica che, tramite prompt costruiti ad arte, induce un modello linguistico ad aggirare le proprie regole di sicurezza e i filtri, portandolo a produrre contenuti che le sue politiche normalmente vietano. -
K
-
KV cache
KV cache (cache chiave-valore): meccanismo che memorizza i tensori di chiave e valore già calcolati per i token precedenti durante la generazione autoregressiva, evitando di ricalcolarli a ogni passo e velocizzando così l'inferenza. -
L
-
Label smoothing
Label smoothing: tecnica di regolarizzazione che sostituisce le etichette target rigide (uno per la classe corretta, zero per le altre) con una distribuzione ammorbidita, riducendo l'eccessiva sicurezza del modello e migliorandone la generalizzazione. -
Layer normalization
Layer normalization: tecnica che normalizza le attivazioni di ogni token in modo indipendente sulle sue feature, riportandole a media zero e varianza unitaria con parametri appresi di scala e traslazione; stabilizza e accelera l'addestramento dei transformer. -
Lemmatizzazione
Lemmatizzazione: tecnica di normalizzazione linguistica che riconduce ogni parola alla sua forma base canonica (il lemma) usando dizionari e regole morfologiche e tenendo conto della categoria grammaticale; a differenza dello stemming produce forme reali. -
Llama
Llama: famiglia di modelli linguistici decoder-only basati su transformer sviluppata da Meta e rilasciata a pesi aperti, distribuita per la ricerca e per l'uso applicativo secondo una licenza dedicata. -
LLM-as-a-judge
LLM-as-a-judge: pratica di valutazione automatica in cui un modello linguistico di grandi dimensioni giudica la qualità delle risposte prodotte da un altro modello, assegnando punteggi o preferenze secondo criteri definiti in un prompt. -
Logit
Logit: valore numerico grezzo e non normalizzato prodotto dallo strato finale di un modello per ciascun token del vocabolario, che viene poi trasformato in una distribuzione di probabilità tramite la funzione softmax. -
Logit bias
Logit bias: parametro che aggiunge un valore fisso ai logit di token specifici prima del campionamento, aumentando o riducendo la loro probabilità di essere generati; permette di favorire o scoraggiare determinate parole in output. -
Long-context model
Long-context model: modello linguistico progettato per elaborare finestre di contesto molto ampie, da decine di migliaia fino a milioni di token, mantenendo la coerenza tra parti distanti del testo grazie ad attenzione e codifica posizionale adeguate. -
LoRA
LoRA (Low-Rank Adaptation): tecnica di fine-tuning efficiente che congela i pesi originali del modello e addestra solo piccole matrici aggiuntive a basso rango inserite negli strati, riducendo drasticamente i parametri da aggiornare e la memoria richiesta. -
M
-
Masked Language Modeling
Masked Language Modeling (MLM): obiettivo di pre-addestramento, reso celebre da BERT, in cui alcuni token della frase vengono mascherati in modo casuale e il modello deve predirli sfruttando il contesto bidirezionale circostante. -
Matrice di co-occorrenza
Matrice di co-occorrenza: tabella che registra quante volte ogni coppia di parole compare insieme entro una finestra di contesto in un corpus; è alla base dei metodi di rappresentazione distribuzionale come GloVe. -
METEOR
METEOR: metrica di valutazione per la traduzione automatica che allinea le parole tra output e riferimento considerando corrispondenze esatte, radici (stemming) e sinonimi, e penalizza le differenze di ordine; correla con i giudizi umani meglio del BLEU. -
Min-p sampling
Min-p sampling: strategia di campionamento che scarta i token la cui probabilità è inferiore a una frazione (min-p) della probabilità del token più probabile; la soglia si adatta alla fiducia del modello, restringendo o ampliando l'insieme dei candidati. -
Mistral
Famiglia di modelli linguistici open-weight sviluppata da Mistral AI: il modello 7B introduce grouped-query attention e sliding window attention per unire buone prestazioni a costi di calcolo e memoria contenuti. -
Mixed precision
Tecnica di addestramento che combina numeri in bassa precisione (come FP16 o BF16) e alta precisione (FP32) per accelerare i calcoli e ridurre l'uso di memoria, mantenendo la stabilita numerica tramite accumuli e scaling in FP32. -
MMLU
Benchmark che valuta conoscenza e ragionamento dei modelli linguistici con domande a scelta multipla su 57 materie, dalla matematica al diritto alla medicina. E un riferimento diffuso per confrontare i modelli, pur esposto al rischio di contaminazione dei dati di test. -
Model Merging
Tecnica che combina i pesi di più modelli addestrati separatamente in un unico modello, ad esempio mediando i parametri, per fondere competenze diverse senza un nuovo addestramento completo. Permette di unire specializzazioni ottenute da fine-tuning distinti a costo ridotto. -
Modello decoder-only
Architettura Transformer che usa solo lo stack decoder e genera testo in modo autoregressivo, predicendo un token alla volta condizionato sui precedenti tramite attenzione mascherata. E la base dei modelli generativi come la famiglia GPT. -
Modello encoder-only
Architettura Transformer che usa solo lo stack encoder e trasforma l'input in rappresentazioni contestuali bidirezionali, senza generare testo. E adatta a compiti di comprensione come classificazione e riconoscimento di entità; BERT ne e l'esempio tipico. -
Modello seq2seq
Architettura encoder-decoder che mappa una sequenza di input in una sequenza di output di lunghezza anche diversa: l'encoder codifica l'input, il decoder genera l'output. E usata per traduzione, riassunto e altri compiti di trasformazione del testo. -
Multi-head attention
Meccanismo del Transformer che esegue più operazioni di attenzione in parallelo, ciascuna con proiezioni distinte di query, key e value, per catturare relazioni diverse tra i token; i risultati delle teste vengono poi concatenati e proiettati. -
Multilinguismo
Capacità di un modello linguistico di comprendere e generare testo in più lingue, spesso grazie a un addestramento su corpora multilingue e a un vocabolario condiviso, che consente anche un certo trasferimento di competenze tra lingue diverse. -
N
-
N-gram
Sequenza contigua di n elementi consecutivi, tipicamente parole o caratteri, estratta da un testo. I modelli linguistici a n-grammi stimano la probabilità di un elemento a partire dai n-1 precedenti e sono un approccio statistico classico al linguaggio. -
Needle in a Haystack
Test di valutazione dei modelli a contesto lungo in cui un'informazione specifica viene nascosta in un testo molto esteso e si verifica se il modello riesce a recuperarla. Misura quanto efficacemente il modello sfrutta l'intera finestra di contesto, non solo le sue estremita. -
Negative sampling
Tecnica di addestramento, introdotta in word2vec, che approssima la funzione di costo distinguendo la coppia osservata da alcuni esempi negativi campionati a caso, invece di normalizzare sull'intero vocabolario, riducendo così il costo computazionale. -
Next Sentence Prediction
Compito di pre-addestramento usato in BERT in cui il modello riceve due frasi e deve predire se la seconda segue effettivamente la prima nel testo originale oppure e stata scelta a caso, così da apprendere relazioni tra frasi. -
Normalizzazione del testo
Insieme di trasformazioni che riportano il testo a una forma standard, ad esempio conversione in minuscolo, gestione uniforme di accenti e punteggiatura, rimozione di spazi superflui. Precede spesso la tokenizzazione nelle pipeline di NLP. -
O
-
One-hot encoding
Rappresentazione di una parola come vettore lungo quanto il vocabolario, con un solo elemento pari a 1 in corrispondenza della parola e tutti gli altri a 0. E sparsa e non cattura la similarità semantica, a differenza degli embedding densi. -
P
-
Padding
Aggiunta di token speciali di riempimento alle sequenze più corte per portarle tutte alla stessa lunghezza, così da poterle elaborare in batch. Una maschera di attenzione indica al modello di ignorare le posizioni di padding. -
PEFT
Parameter-Efficient Fine-Tuning: famiglia di tecniche che adatta un modello pre-addestrato aggiornando solo una piccola frazione dei parametri, o aggiungendone di nuovi, e lasciando congelato il resto. Riduce costi di calcolo e memoria; comprende metodi come LoRA e prefix tuning. -
Perplexity
Metrica che valuta un modello linguistico misurando quanto e incerto nel predire una sequenza di test; corrisponde all'esponenziale della cross-entropy media per token. Valori più bassi indicano previsioni migliori. -
Pooling delle rappresentazioni
Operazione che aggrega i vettori dei singoli token in un'unica rappresentazione di lunghezza fissa per una frase o un documento, ad esempio con la media (mean pooling), il massimo o l'uso del token speciale di classificazione. -
POS tagging
Part-of-speech tagging: compito che assegna a ciascuna parola di un testo la sua categoria grammaticale, come nome, verbo, aggettivo o preposizione, tenendo conto del contesto per risolvere le ambiguita. -
Positional encoding
Informazione aggiunta agli embedding dei token per rappresentarne la posizione nella sequenza, necessaria perché l'attenzione del Transformer e di per se invariante all'ordine. Può essere fissa, con funzioni sinusoidali, oppure appresa. -
Prefix tuning
Tecnica di fine-tuning efficiente che antepone una sequenza di vettori continui addestrabili, il prefisso, all'input di ogni strato del Transformer, ottimizzando solo tali vettori e lasciando congelati i pesi del modello. -
Prompt injection
Attacco alla sicurezza dei modelli linguistici in cui un aggressore inserisce istruzioni malevole nel testo di input, o in dati esterni recuperati, per aggirare le istruzioni originali e alterare il comportamento del modello. -
Prompt template linguistico
Struttura riutilizzabile di prompt con segnaposto in cui inserire input variabili, così da formulare le richieste al modello in modo coerente e ripetibile per un dato compito. E alla base delle pipeline di prompting. -
Prompt tuning
Tecnica di fine-tuning efficiente che apprende un insieme di vettori di prompt continui, detti soft prompt, anteposti all'input, lasciando completamente invariati i pesi del modello pre-addestrato e ottimizzando solo questi vettori. -
Pruning
Tecnica di compressione che elimina dal modello i parametri o le connessioni meno influenti, riducendone dimensione e costo computazionale. Può essere non strutturata, su singoli pesi, o strutturata, su interi neuroni, teste o strati. -
Q
-
QLoRA
Variante efficiente di LoRA che effettua il fine-tuning applicando adattatori a basso rango su un modello base quantizzato a 4 bit, riducendo drasticamente la memoria necessaria senza addestrare i pesi originali. -
Quantizzazione
Tecnica di compressione che rappresenta i pesi, ed eventualmente le attivazioni, di un modello con un numero ridotto di bit, ad esempio da 32 a 8 o 4 bit, per risparmiare memoria e accelerare l'inferenza con una minima perdita di qualità. -
Query, Key, Value
I tre vettori che ogni token produce nel meccanismo di attenzione: la query interroga, le key vengono confrontate con essa per calcolare i pesi di attenzione e i value forniscono il contenuto che viene combinato secondo tali pesi. -
R
-
ReAct
ReAct (Reasoning and Acting): schema di prompting per agenti che alterna passi di ragionamento espressi in linguaggio naturale e azioni verso strumenti esterni, usando le osservazioni ottenute per guidare i passi successivi. -
Red teaming
Pratica di valutazione della sicurezza in cui si sollecita deliberatamente un modello con input ostili o ingannevoli per scoprirne vulnerabilita, output dannosi o comportamenti indesiderati prima del rilascio. -
Repetition penalty
Parametro di decodifica che riduce la probabilità di generare nuovamente token già comparsi nel testo, per contrastare ripetizioni e cicli. Un valore troppo alto può pero penalizzare parole legittimamente frequenti. -
Reranking
Tecnica che, dato un insieme di documenti recuperati da un primo sistema di ricerca, ne riordina i risultati usando un modello più preciso che ne valuta la rilevanza rispetto alla query. E usata nelle pipeline di retrieval e RAG. -
Residual connection
Collegamento che somma l'input di un sotto-strato alla sua uscita (skip connection), facilitando il flusso del gradiente e l'addestramento di reti profonde. Nel Transformer accompagna ogni blocco di attenzione e feed-forward. -
Retrieval reranker
Componente di una pipeline di recupero che riordina i documenti candidati restituiti dalla ricerca iniziale, assegnando a ciascuno un punteggio di rilevanza più accurato rispetto alla query, spesso tramite un modello cross-encoder. -
RoBERTa
Variante di BERT (Robustly Optimized BERT Approach) addestrata più a lungo, con batch più grandi e molti più dati, che rimuove il compito di next sentence prediction e adotta il masking dinamico, ottenendo prestazioni migliori. -
RoPE
Rotary Position Embedding: tecnica che codifica la posizione ruotando i vettori query e key di un angolo proporzionale all'indice del token. Il prodotto scalare dell'attenzione dipende così dalla posizione relativa tra i token. -
Rotary embeddings
Sinonimo di RoPE: metodo di codifica posizionale che incorpora la posizione dei token applicando rotazioni ai vettori query e key nell'attenzione, in modo che le relazioni dipendano dalla distanza relativa tra le posizioni. -
ROUGE
Recall-Oriented Understudy for Gisting Evaluation: insieme di metriche che valutano riassunti e testi generati misurando la sovrapposizione di n-grammi e sottosequenze con uno o più testi di riferimento. E molto usata nel riassunto automatico. -
S
-
Sampling
Strategia di decodifica in cui, a ogni passo, il token successivo viene estratto casualmente dalla distribuzione di probabilità del modello, anziché scegliere sempre il più probabile. Regolata da temperatura e da varianti come top-k e top-p (nucleus), aumenta varieta e creativita al prezzo di minore determinismo. -
Self-attention
Meccanismo, cuore dei Transformer (Vaswani et al., 2017), in cui ogni token calcola pesi di attenzione verso tutti gli altri token della sequenza tramite vettori query, key e value. Così ogni rappresentazione integra il contesto rilevante, catturando in parallelo dipendenze a lungo raggio senza ricorrenza. -
Self-consistency
Tecnica di prompting proposta da Wang et al. nel 2022 che, invece di una singola catena di ragionamento, campiona più percorsi di reasoning con decodifica stocastica e sceglie la risposta finale più frequente per voto di maggioranza, migliorando l'accuratezza nei compiti aritmetici e logici. -
Sentence embedding
Rappresentazione vettoriale densa che codifica il significato complessivo di un'intera frase in uno spazio a dimensione fissa, dove frasi semanticamente simili risultano vicine. Prodotta da modelli come Sentence-BERT, abilita ricerca semantica, clustering e recupero tramite misure come la similarità coseno. -
SentencePiece
Libreria di tokenizzazione di Kudo e Richardson (2018) che tratta il testo come flusso grezzo di caratteri Unicode, senza pre-segmentazione basata sugli spazi. Implementa gli algoritmi BPE e unigram, è indipendente dalla lingua e gestisce bene idiomi senza separatori di parola come cinese e giapponese. -
Similarità del coseno
Misura di similarità tra due vettori data dal coseno dell'angolo che li separa, ossia dal prodotto scalare diviso per il prodotto delle norme. Varia da -1 a 1 ed è indipendente dalla lunghezza dei vettori, valutando solo l'orientamento: è molto usata per confrontare embedding testuali e nel recupero di informazioni. -
Skip-gram
Architettura del modello Word2Vec, introdotto da Mikolov e colleghi (Google) nel 2013, che apprende word embedding predicendo le parole di contesto circostanti data una parola centrale. E complementare al modello CBOW, che fa il contrario; funziona bene con parole rare e grandi corpora, spesso con negative sampling. -
Sliding window attention
Meccanismo di attenzione sparsa in cui ogni token attende solo i token entro una finestra locale di dimensione fissa, anziché l'intera sequenza. Riduce il costo da quadratico a lineare rispetto alla lunghezza, abilitando contesti lunghi; usato in Longformer e Mistral, dove impilando più strati il campo recettivo effettivo cresce oltre la finestra. -
Softmax
Funzione che trasforma un vettore di valori reali (logit) in una distribuzione di probabilità: esponenzia ciascun elemento e lo normalizza per la somma degli esponenziali, ottenendo valori positivi che sommano a uno. Nei modelli linguistici converte i punteggi sul vocabolario in probabilità dei token. -
Sparse retrieval
Recupero di documenti basato sulla corrispondenza lessicale dei termini, rappresentati con vettori sparsi ad alta dimensione in cui la maggior parte dei pesi e nulla. Usa modelli a parole chiave come TF-IDF e BM25; e efficiente e interpretabile, ma coglie meno la somiglianza semantica rispetto al dense retrieval. -
Special token
Simbolo riservato del vocabolario che non corrisponde a testo naturale ma svolge una funzione di controllo, come inizio e fine sequenza, separatore, padding o mascheramento (ad esempio [CLS], [SEP], [PAD]). Guida la strutturazione dell'input e il comportamento del modello. -
Speculative decoding
Tecnica di accelerazione dell'inferenza dei modelli linguistici, introdotta da Leviathan et al. (Google, 2023): un piccolo modello ausiliario propone più token, che il modello grande verifica in un solo passaggio parallelo, accettandoli o correggendoli. Accelera la generazione preservando la stessa distribuzione. -
Stemming
Tecnica di normalizzazione testuale che taglia i suffissi delle parole per ricondurle a una radice comune, unificando le forme flesse. La radice ottenuta non è sempre una parola valida; è più rapida ma meno accurata della lemmatizzazione. Un algoritmo classico è lo stemmer di Porter (1980). -
Step-back prompting
Tecnica di prompting di Google DeepMind (2023) che, prima di rispondere a una domanda specifica, chiede al modello di formulare e risolvere una domanda più generale sui principi o concetti di fondo, per poi usarli come guida al ragionamento. Migliora l'accuratezza su compiti di ragionamento STEM e multi-hop. -
Stopwords
Parole molto frequenti e poco informative di una lingua, come articoli, preposizioni e congiunzioni, che in alcune pipeline di NLP e nei motori di ricerca vengono rimosse per ridurre rumore e dimensione dei dati. La lista e specifica per lingua; nei modelli basati su Transformer di norma non si eliminano. -
Structured output
Generazione vincolata di un modello linguistico affinché l'uscita rispetti un formato preciso, come JSON conforme a uno schema o una grammatica formale. Si ottiene con constrained decoding, function calling o grammatiche, garantendo output parsabili e integrabili nel software a valle; riduce gli errori di formato nelle pipeline applicative e negli agenti. -
Subword
Unità di tokenizzazione intermedia, più piccola della parola ma più grande del carattere, con cui i modelli scompongono i termini. Permette di rappresentare parole rare o mai viste componendole da frammenti noti, limitando il vocabolario e i token fuori dizionario. Algoritmi diffusi sono BPE, WordPiece e SentencePiece. -
Subword regularization
Tecnica introdotta da Kudo (2018) che, invece di usare una segmentazione fissa in subword, campiona a ogni passo di addestramento una delle molte tokenizzazioni possibili di una parola, in genere con un modello unigram. Questa variabilita rende il modello più robusto al rumore ed e implementata in SentencePiece. -
Supervised Fine-Tuning
Fase di adattamento in cui un modello pre-addestrato viene ulteriormente allenato in modo supervisionato su coppie di input e output etichettati, tipicamente istruzioni e risposte desiderate. Nei modelli linguistici precede spesso l'allineamento con RLHF e ne definisce lo stile di risposta. -
T
-
T5
T5 (Text-to-Text Transfer Transformer), introdotto da Raffel et al. (Google, 2020), e un modello Transformer encoder-decoder che riformula ogni compito NLP, dalla traduzione al riassunto, come trasformazione da testo a testo. Preaddestrato sul corpus C4 con mascheramento di span, si guida con un prefisso testuale. -
Teacher forcing
Tecnica di addestramento dei modelli sequenziali autoregressivi in cui a ogni passo si fornisce in input il token corretto di riferimento, anziché quello predetto dal modello al passo precedente. Accelera e stabilizza l'apprendimento, ma può creare un disallineamento (exposure bias) tra addestramento e inferenza. -
TF-IDF
Schema di pesatura dei termini che moltiplica la frequenza di una parola in un documento (TF) per l'inverso della sua diffusione nella collezione (IDF, logaritmo del rapporto tra numero di documenti e documenti che la contengono). Dà peso alto ai termini frequenti ma distintivi, alla base del recupero di informazioni. -
Tokenizzazione a caratteri
Strategia di tokenizzazione che segmenta il testo nei singoli caratteri anziché in parole o subword. Produce un vocabolario molto piccolo e gestisce senza problemi parole sconosciute e refusi, ma genera sequenze lunghe e sposta sul modello l'onere di ricostruire il significato delle unità maggiori. -
Tokenizzazione a parole
Approccio di segmentazione del testo che separa le parole intere usando spazi e punteggiatura come delimitatori. Semplice e interpretabile, produce però vocabolari molto grandi e non gestisce bene le parole fuori vocabolario; per questo nei modelli moderni è spesso sostituita da metodi subword come BPE, WordPiece o SentencePiece. -
Tokenizzazione di frase
Suddivisione di un testo nelle singole frasi che lo compongono, individuandone i confini. Il compito e meno banale del semplice punto fermo, perché abbreviazioni, numeri decimali e sigle contengono punti ambigui; strumenti come NLTK Punkt o spaCy usano regole ed euristiche. E spesso il primo passo di una pipeline NLP. -
Top-k sampling
Strategia di decodifica dei modelli linguistici che, a ogni passo, restringe la scelta ai k token con probabilità più alta, rinormalizza le loro probabilità e campiona tra essi. Limitando la coda meno probabile riduce le incoerenze rispetto al campionamento puro; il parametro k regola la casualita del testo generato. -
Toxicity detection
Identificazione automatica di linguaggio offensivo, dannoso o d'odio nei testi, formulata come compito di classificazione. Impiega modelli addestrati su dati etichettati e serve a moderare i contenuti; deve gestire contesto, ironia e bias per contenere i falsi positivi. -
Tree of Thoughts
Tree of Thoughts (ToT), proposto da Yao et al. nel 2023, e una strategia di prompting che generalizza la chain-of-thought: il modello genera più pensieri intermedi organizzati ad albero, li autovaluta ed esplora i rami con una ricerca, consentendo lookahead e backtracking in compiti che richiedono pianificazione. -
Truncation
Operazione di pre-elaborazione che taglia le sequenze di testo più lunghe della lunghezza massima di contesto ammessa dal modello, scartando i token in eccesso all'inizio o alla fine della sequenza. È complementare al padding, che allunga le sequenze troppo corte; evita errori ma può causare perdita di informazione. -
U
-
Unigram Language Model
Algoritmo di tokenizzazione a sottoparole proposto da Kudo nel 2018, usato in SentencePiece. Parte da un vocabolario ampio di candidati e ne rimuove iterativamente, tramite l'algoritmo EM, le unità meno utili alla verosimiglianza del corpus. A differenza di BPE modella più segmentazioni con probabilità. -
V
-
Vocabolario di token
Insieme finito e predefinito delle unità testuali (token) che un modello linguistico e in grado di riconoscere in input e produrre in output. Ogni token ha un identificatore numerico; la sua dimensione, spesso decine di migliaia di elementi, e fissata dal tokenizer, ad esempio tramite Byte Pair Encoding. -
Vocabolario fuori distribuzione
Termine out-of-vocabulary (OOV): parola o token assente dal vocabolario del modello e incontrato in fase di inferenza. Viene gestito con un token speciale come UNK oppure, nei modelli moderni, scomponendolo in unità subword con BPE o WordPiece, così da coprire termini rari, nomi propri e neologismi senza perdere del tutto l'informazione. -
W
-
Warmup del learning rate
Tecnica di scheduling in cui il tasso di apprendimento parte da un valore molto basso e cresce gradualmente nelle prime iterazioni, prima di seguire il decadimento previsto. Evita aggiornamenti destabilizzanti quando i pesi sono ancora casuali e i gradienti rumorosi; e prassi comune nei Transformer. -
Word Error Rate (WER)
Metrica standard per valutare il riconoscimento vocale e la trascrizione, pari alla somma di inserimenti, cancellazioni e sostituzioni di parole rispetto al riferimento, divisa per il numero di parole del riferimento. Deriva dalla distanza di edit di Levenshtein; un WER più basso indica una trascrizione migliore. -
Word sense disambiguation
Compito NLP che assegna a una parola polisemica il significato corretto tra quelli possibili in base al contesto, spesso rispetto a un inventario di sensi come WordNet. Utile nella traduzione automatica e nel recupero di informazioni, è affrontato con metodi supervisionati o basati su conoscenza. -
Word2Vec
Word2Vec, sviluppato da Mikolov et al. (Google, 2013), e una famiglia di modelli che apprende embedding densi delle parole tramite reti neurali superficiali, nelle varianti CBOW (predice la parola dal contesto) e skip-gram (predice il contesto). I vettori catturano relazioni semantiche misurabili aritmeticamente. -
WordPiece
Algoritmo di tokenizzazione a subword introdotto da Schuster e Nakajima (2012) e adottato da BERT. Parte dai caratteri e, a differenza di BPE, fonde la coppia che massimizza la verosimiglianza del corpus, ossia col punteggio più alto dato dal rapporto tra la frequenza della coppia e quella dei singoli simboli. -
X
-
XLNet
Modello di pre-addestramento del linguaggio di Yang et al. (2019) che unisce il contesto bidirezionale di BERT alla fattorizzazione autoregressiva. Con il permutation language modeling predice ogni token su ordini permutati della sequenza, evitando i token [MASK], e usa la two-stream attention su Transformer-XL.