Objetivos y diseño del corpus
El corpus se centra en entrevistas semiestructuradas realizadas en el área germanófona con hispanohablantes de la 1a, 2a y 3a generación. Las entrevistas abordan temas cotidianos (familia, escuela / trabajo, amistades, etc.) así como actitudes lingüísticas y sociales.
Cada entrevista se graba en audio, se transcribe en español y se enriquece con información lingüística y paralingüística. El objetivo es ofrecer un recurso abierto para la investigación en:
- adquisición bilingüe y contacto de lenguas,
- variación y cambio en el español en contextos migratorios,
- uso de lenguas en la familia y en la escuela,
- docencia de lingüística hispánica y didáctica del español.
Participantes y material
Cada archivo JSON incluye metadatos detallados sobre las entrevistas (fecha, lugar, edad, sexo, lugar de nacimiento y residencia, generación migratoria, etc.).
Información téchnica
Transcripción y anotación lingüística
Las entrevistas se transcriben ortográficamente en español y se segmentan en oraciones. A partir de estas transcripciones, cada palabra se anota semiautomáticamente con:
- lemas
- categorías gramaticales según las directrices del proyecto Universal Dependencies
- rasgos morfológicos detallados (persona, número, tiempo, modo, género)
- relaciones de dependencia sintáctica entre las palabras
- rasgos paralingüísticos (p. ej. hesitaciones, palabras de relleno, gestos)
- y para determinadas entrevistas seleccionadas, una transcripción fonética
La anotación se ha realizado con el modelo de spaCy es_dep_news_trf y se almacena en formato JSON, de modo que cada oración incluye su texto y la lista de tokens con sus atributos lingüísticos.
Licencia y condiciones de uso
Los datos se publican como recurso de acceso abierto bajo licencia CC BY-NC-ND 4.0. Esto significa que el contenido de este corpus puede ser consultado, citado, reproducido y distribuido libremente sólo para fines de investigación, enseñanza y divulgación académica, siempre y cuando se cumplan las siguientes condiciones:
- Atribución obligatoria: Todo uso del corpus debe incluir una referencia completa al recurso original (véase más abajo).
- No comercial: No se puede hacer uso del material con propósitos comerciales.
- Sin derivadas: Si remezcla, transforma o crea a partir del material, no podrá distribuir el material modificado.
Al utilizar este corpus, usted acepta las condiciones establecidas. Para más información sobre los términos legales completos, consulte la página oficial de Creative Commons.
Cita recomendada
Guzmán Riverón, Martha (dir). (2025-): Corpus del Español del Área del Alemán. Disponible en: http://www.coresaa.univie.ac.at.