Acerca del proyecto

CORESAA: Corpus de Español del Área del Áleman

El Corpus de Español del Área del Áleman es un proyecto para la documentación del uso del español en el mundo germanófono. Con sede en Viena, el corpus contiene actualmente datos procedentes principalmente de Austria; sin embargo, esperamos poder incluir pronto entrevistas de cualquier lugar del mundo donde se hable alemán como lengua principal.

Objetivos y diseño del corpus

El corpus se centra en entrevistas semiestructuradas realizadas en el área germanófona con hispanohablantes de la 1a, 2a y 3a generación. Las entrevistas abordan temas cotidianos (familia, escuela / trabajo, amistades, etc.) así como actitudes lingüísticas y sociales.

Cada entrevista se graba en audio, se transcribe en español y se enriquece con información lingüística y paralingüística. El objetivo es ofrecer un recurso abierto para la investigación en:

  • adquisición bilingüe y contacto de lenguas,
  • variación y cambio en el español en contextos migratorios,
  • uso de lenguas en la familia y en la escuela,
  • docencia de lingüística hispánica y didáctica del español.

Participantes y material

Cada archivo JSON incluye metadatos detallados sobre las entrevistas (fecha, lugar, edad, sexo, lugar de nacimiento y residencia, generación migratoria, etc.).

Información téchnica

Transcripción y anotación lingüística

Las entrevistas se transcriben orto­gráfica­mente en español y se segmentan en oraciones. A partir de estas transcripciones, cada palabra se anota semi­automátic­amente con:

  • lemas
  • categorías gramaticales según las directrices del proyecto Universal Dependencies
  • rasgos morfológicos detallados (persona, número, tiempo, modo, género)
  • relaciones de dependencia sintáctica entre las palabras
  • rasgos paralingüísticos (p. ej. hesitaciones, palabras de relleno, gestos)
  • y para determinadas entrevistas seleccionadas, una transcripción fonética

La anotación se ha realizado con el modelo de spaCy es_dep_news_trf y se almacena en formato JSON, de modo que cada oración incluye su texto y la lista de tokens con sus atributos lingüísticos.

Licencia y condiciones de uso

Los datos se publican como recurso de acceso abierto bajo licencia CC BY-NC-ND 4.0. Esto significa que el contenido de este corpus puede ser consultado, citado, reproducido y dis­tri­buido libre­mente sólo para fines de investi­gación, enseñ­anza y di­vul­gación aca­démica, siem­pre y cuan­do se cum­plan las sigui­entes con­dici­ones:

  • Atribución obligatoria: Todo uso del corpus debe incluir una referencia completa al recurso original (véase más abajo).
  • No comercial: No se puede hacer uso del material con propósitos comerciales.
  • Sin derivadas: Si remezcla, transforma o crea a partir del material, no podrá distribuir el material modificado.

Al utilizar este corpus, usted acepta las condiciones establecidas. Para más información sobre los términos legales completos, consulte la página oficial de Creative Commons.

Cita recomendada

Guzmán Riverón, Martha (dir). (2025-): Corpus del Español del Área del Alemán. Disponible en: http://www.coresaa.univie.ac.at.

Resumen técnico

Formato de los datos:
JSON estructurado (metadatos + oraciones + tokens)

Información por participante:
rol en la entrevista, sexo, edad, lugar de nacimiento y residencia, generación migratoria

Información por token:
forma, lema, UPOS, rasgos morfológicos, dependencia sintáctica

Idioma de anotación:
español (modelo spaCy es_dep_news_trf)

Responsables del proyecto

Este corpus se creó original­mente como parte de un proyecto de doctorado; sin embargo, rápid­amente atrajo a colabora­dores de todo el mundo germano­parlante. A contin­uación se enumeran los colabora­dores con su código de entrevis­tador, cuando procede.

Dirección y concepto:
Univ.-Prof. Dr. Martha Guzmán Riverón Departamiento de Estudios Románicos,
Universität Wien
Spitalgasse 2, 1090 Wien


Desarrollo técnico:
Christopher Owain Carter, M.A.
Departamiento de Estudios Románicos,
Universität Wien
Spitalgasse 2, 1090 Wien

Colaboración científica

  • Christopher Owain Carter (ENT1)
  • Mag. Teresita Marína Álvarez Muñoz (ENT2)
  • Kiril Dimitrov (ENT3)