Metodo
Come si stabilisce l’ordine
Tutto il sito poggia su un’affermazione: che questo sia il vero ordine dell’inglese per frequenza. Quell’affermazione vale qualcosa solo se il calcolo è visibile, ed eccolo.
I corpora
PARLATO
OpenSubtitles 2018
Sottotitoli di film e serie. Ottimi per l’inglese di conversazione, e il motivo per cui una lista costruita solo su di essi sopravvaluta le interiezioni.
STAMPA
Leipzig Corpora — news 2023
Giornalismo in lingua inglese. Porta il lessico della vita pubblica — governo, economia, diritto — che il dialogo sfiora appena.
ENCICLOPEDICO
Leipzig Corpora — Wikipedia 2016
Prosa formale e descrittiva, la fonte che tiene il lessico astratto e tecnico nelle giuste proporzioni.
Un corpus è un genere, non una lingua. I sottotitoli da soli ti insegnerebbero a seguire un film e ti lascerebbero perso davanti a un giornale; Wikipedia da sola farebbe il contrario. Ogni parola è ordinata su come si comporta in tutti e tre.
Come vengono combinati
01
Tassi, non conteggi
I corpora hanno dimensioni diverse, quindi i conteggi grezzi non sono confrontabili. Ciascuno viene prima convertito in occorrenze per milione di parole.
02
Media geometrica
I tre tassi vengono mediati in scala logaritmica. Questo premia la parola mediamente comune ovunque rispetto a quella che esplode in un solo registro.
03
Che cosa viene tolto
I nomi propri, riconosciuti da quanto spesso la parola compare con la maiuscola nelle fonti che conservano le maiuscole. Più abbreviazioni e detriti del web. Una parola deve comparire in almeno due corpora per essere ordinata.
04
Che cosa viene aggiunto
La pronuncia, da CMUdict. Categorie, livelli, frasi d’esempio e traduzioni sono scritti a mano.
Che cosa ci ha fatto cambiare l’inglese
- La pronuncia è archiviata, non dedotta. L’ortografia spagnola predice il suono abbastanza bene da calcolarlo; quella inglese no, perciò ogni trascrizione viene da CMUdict. È inglese americano standard e in trascrizione larga: la vocale britannica di “bath” non è quella mostrata qui.
- Le fonti non concordano sugli apostrofi. Leipzig li conserva; la lista dei sottotitoli spezza su di essi, così “don’t” arriva come “don” più “t”. Vengono ordinate solo le parole puramente alfabetiche, e il corpus dei sottotitoli si astiene su quelle radici invece di contarle: altrimenti “don” starebbe al posto 535 con quattro milioni di occorrenze che sono tutte “don’t”.
- “I” si scrive sempre maiuscolo, così il filtro sui nomi propri lo scartava finché non è stato indicato come eccezione. Allentare il filtro avrebbe invece rifatto entrare nomi propri veri.
- Le grafie britannica e americana compaiono come voci distinte — centre e center, defence e defense — perché le parole sono ordinate come si scrivono. È onesto verso i dati e poco utile a chi impara, e potrà cambiare.
Che cosa non è finito
- Il lessico si scrive a mano, un blocco alla volta. 1001 delle 5000 parole hanno categoria, livello e frase d’esempio; le altre hanno una posizione e una pronuncia e nient’altro, e la lista dice quali sono invece di lasciartelo scoprire.
- I valori di copertura sono misurati su questi corpora, lasciando nomi propri e numerali al denominatore. Per questo sono più bassi delle cifre di solito citate: le prime 1000 parole coprono il 72.6% del dialogo sottotitolato, ma solo il 59.4% in media su dialogo, stampa e prosa enciclopedica. Citare solo la prima cifra è il modo in cui “1000 parole sono il 75% dell’inglese” è diventato luogo comune.
- Tre corpora restano tre corpora. L’inglese parlato che non diventa mai un sottotitolo, il lessico regionale e i registri specialistici sono sottorappresentati.
Lo stesso metodo, per lo spagnolo
cincomil ordina le 5000 parole spagnole più frequenti a partire dagli stessi tre tipi di corpus, combinati allo stesso modo, con lo stesso filtro sui nomi propri e lo stesso rifiuto di citare una copertura non misurata.