Método
Cómo se decide el orden
Todo el sitio depende de una afirmación: que este es el orden real del inglés por frecuencia. Esa afirmación solo vale algo si se ve el procedimiento, así que aquí está.
Los corpus
HABLADO
OpenSubtitles 2018
Subtítulos de cine y televisión. Excelentes para el inglés conversacional, y la razón por la que una lista hecha solo con ellos sobrevalora las interjecciones.
PRENSA
Leipzig Corpora — news 2023
Periodismo en lengua inglesa. Aporta el vocabulario de la vida pública —política, economía, derecho— que el diálogo apenas roza.
ENCICLOPÉDICO
Leipzig Corpora — Wikipedia 2016
Prosa formal y descriptiva, y la fuente que mantiene en proporción el vocabulario abstracto y técnico.
Un corpus es un género, no una lengua. Los subtítulos por sí solos te enseñarían a seguir una película y te dejarían perdido ante un periódico; Wikipedia sola haría lo contrario. Cada palabra se ordena según cómo se comporta en los tres.
Cómo se combinan
01
Tasas, no recuentos
Los corpus tienen tamaños distintos, así que los recuentos brutos no se pueden comparar. Cada uno se convierte primero en apariciones por millón de palabras.
02
Media geométrica
Las tres tasas se promedian en escala logarítmica. Eso premia a la palabra que es medianamente frecuente en todas partes frente a la que se dispara en un solo registro.
03
Qué se elimina
Los nombres propios, detectados por la frecuencia con que la palabra aparece en mayúscula en las fuentes que conservan el caso. Además, abreviaturas y restos de la web. Una palabra debe aparecer al menos en dos corpus para entrar en la lista.
04
Qué se añade
La pronunciación, tomada de CMUdict. Las categorías, los niveles, los ejemplos y las traducciones se escriben a mano.
Lo que el inglés nos obligó a cambiar
- La pronunciación se almacena, no se deduce. La ortografía del español predice el sonido lo bastante bien como para calcularla; la del inglés no, así que cada transcripción viene de CMUdict. Es inglés americano general y de transcripción amplia: la vocal británica de «bath» no es la que verás aquí.
- Las fuentes no coinciden en los apóstrofos. Leipzig los conserva; la lista de subtítulos parte por ellos, de modo que «don’t» llega como «don» más «t». Solo se ordenan las palabras alfabéticas, y el corpus de subtítulos se abstiene con esas raíces en lugar de contarlas: si no, «don» aparecería en el puesto 535 con cuatro millones de apariciones que en realidad son «don’t».
- «I» se escribe siempre con mayúscula, así que el filtro de nombres propios la descartaba hasta que se la nombró como excepción. Relajar el filtro habría dejado entrar nombres propios de verdad.
- Las grafías británica y estadounidense figuran como entradas distintas —centre y center, defence y defense— porque las palabras se ordenan tal como se escriben. Es honesto con los datos y poco útil para quien aprende, y puede que cambie.
Lo que no está terminado
- El léxico se escribe a mano, por tandas. 1001 de las 5000 palabras tienen categoría, nivel y frase de ejemplo; el resto tiene puesto y pronunciación y nada más, y la lista dice cuál es cuál en vez de dejar que lo descubras.
- Las cifras de cobertura están medidas sobre estos corpus, dejando los nombres propios y los numerales en el denominador. Por eso son más bajas que las que suelen citarse: las primeras 1000 palabras cubren el 72.6% del diálogo de subtítulos, pero solo el 59.4% como media de diálogo, prensa y prosa enciclopédica. Citar solo la primera cifra es como «1000 palabras son el 75% del inglés» se volvió folclore.
- Tres corpus siguen siendo tres corpus. El inglés hablado que nunca llega a subtítulo, el vocabulario regional y los registros especializados están infrarrepresentados.