1. Inicio
  2. Lengua y gramática
  3. Corpus lingüístico

Significado de Corpus lingüístico

Sustantivo masculino, invariable en plural (el corpus, los corpus). Del latín corpus, «cuerpo».

Un corpus lingüístico es un conjunto extenso y estructurado de textos reales, orales o escritos, reunido para estudiar el uso efectivo de una lengua con la ayuda de programas informáticos.

Se distingue de una simple colección de textos por estar diseñado con criterios de representatividad y por poder consultarse mediante herramientas de búsqueda de frecuencias y concordancias.

Qué es un corpus lingüístico

Un corpus lingüístico reúne textos producidos de forma natural, no inventados por el investigador, para observar cómo se usa realmente una lengua: qué palabras aparecen juntas, con qué frecuencia, en qué registros y en qué contextos. La lexicografía y la gramática académica se apoyan cada vez más en corpus para decidir si una palabra o una construcción está lo bastante extendida como para incluirse en el diccionario o describirse como norma.

Un buen corpus no es una simple acumulación de textos: se construye siguiendo criterios de representatividad (variedad de autores, épocas, países, tipos de texto) y se etiqueta o marca de forma que permita hacer búsquedas precisas, por ejemplo localizar todas las apariciones de una palabra como verbo y no como sustantivo.

La Real Academia Española mantiene varios corpus de referencia del español, entre ellos el CORPES XXI, dedicado al español actual de todo el mundo hispánico, y el CORDE, centrado en textos históricos.

Origen de la palabra corpus

Del latín corpus, «cuerpo», usado en sentido figurado para designar un conjunto amplio y organizado de textos, de la misma manera que se habla de un «cuerpo doctrinal» o un «cuerpo legal».

El estudio de textos reales para describir una lengua es antiguo, pero el corpus lingüístico como herramienta sistemática y consultable se desarrolló sobre todo a partir de mediados del siglo XX, cuando la disponibilidad de ordenadores permitió almacenar millones de palabras y buscar en ellas de forma automática, algo impensable cuando el análisis dependía por completo del trabajo manual.

Tipos de corpus lingüístico

TipoEn qué consisteEjemplo
DiacrónicoReúne textos de distintas épocas para estudiar la evolución de la lengua.el CORDE de la RAE
SincrónicoRecoge textos de un periodo concreto, casi siempre el actual.el CORPES XXI
OralRecoge grabaciones transcritas de conversaciones espontáneas.corpus de habla coloquial
ParaleloAlinea un texto y su traducción a otra lengua.corpus para entrenar traductores automáticos
EspecializadoSe limita a un campo temático o un tipo de texto concreto.corpus de textos médicos

Ejemplos de uso de corpus lingüístico

La RAE elabora el CORPES XXI, un corpus lingüístico del español actual de todo el mundo hispánico.

Un corpus paralelo alinea un texto y su traducción para entrenar sistemas de traducción automática.

Los lexicógrafos consultan un corpus lingüístico para comprobar si una palabra se usa realmente antes de incluirla en el diccionario.

Un corpus oral recoge grabaciones transcritas de conversaciones espontáneas para estudiar el habla coloquial.

Un corpus diacrónico como el CORDE permite rastrear cuándo aparece documentada por primera vez una palabra.

Sinónimos y palabras relacionadas

Sinónimos: no tiene un sinónimo exacto de una sola palabra; «banco de datos textuales» es una paráfrasis aproximada.

Antónimos: no aplica.

No es lo mismo que:

Preguntas frecuentes sobre corpus lingüístico

¿Para qué sirve un corpus lingüístico?

Sirve para estudiar con datos reales cómo se usa una lengua: qué palabras son frecuentes, con qué otras se combinan y cómo cambia su uso según la época, el país o el tipo de texto.

¿Qué diferencia hay entre un corpus y un diccionario?

El corpus reúne ejemplos reales de uso sin explicarlos; el diccionario, en cambio, selecciona, define y ordena los significados de las palabras, muchas veces apoyándose en lo que muestra un corpus.

¿Qué corpus del español usa la RAE?

Entre otros, el CORPES XXI para el español actual, el CORDE para textos históricos y el CREA como antecedente del CORPES centrado en el español de finales del siglo XX.

Ver también