International Journal of Bilingualism· 2026Q1
Kaliforniya'da Çok Dilli Hispanik Konuşma (MuHSiC): Büyük Ölçekli Açık Erişimli İspanyolca–İngilizce İki Dilli Derlem
Multilingual Hispanic Speech in California (MuHSiC): A Large-Scale Open-Access Spanish–English Bilingual Corpus
- 0atıf
- Q1SCImago
- 2026yıl
Kısa özet
Bugüne kadarki en büyük açık erişimli İspanyolca-İngilizce iki dilli konuşma veri kümesi olan MuHSiC derlemi, tekrarlanabilir iki dillilik araştırmalarını destekleyen, fonem düzeyinde hizalanmış 700 saatin üzerinde sosyolinguistik tabakalı kayıt sunmaktadır.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Ana noktalar
- Bugüne kadarki en büyük açık erişimli İspanyolca-İngilizce iki dilli konuşma derlemi olan MuHSiC'i tanıtmaktadır (700 saatin üzerinde).
- Derlem, ayrıntılı konuşmacı meta verileriyle sosyolinguistik olarak tabakalandırılmıştır.
- 4,7 milyon zaman hizalı kelime belirteci ve 16 milyondan fazla fonolojik segment içermektedir.
- İki dillilik fonolojisi, fonetiği, morfosentaksı ve dil teması alanlarında tekrarlanabilir araştırmalar için tasarlanmıştır.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Özet (abstract)
Aims and Objectives / Purpose / Research Questions: This article introduces the Multilingual Hispanic Speech in California (MuHSiC) corpus. It addresses two primary questions: (a) how can a large-scale, open-access corpus be designed to capture the linguistic diversity of Spanish–English bilingualism in California, and (b) how can such a resource support reproducible research across linguistic subfields? Design / Methodology / Approach: MuHSiC was constructed as a sociolinguistically stratified spoken corpus based on systematically collected bilingual interviews. The project integrates high-fidelity audio recording, standardized transcription protocols, phoneme-level forced alignment, acoustic extraction, and structured metadata collection to produce a research-ready, publicly distributable dataset. Data and Analysis: The corpus comprises 600 recordings from bilingual speakers representing diverse social and regional backgrounds across California. Each recording is approximately 70 min in length, evenly divided between Spanish and English, yielding over 42,720 min (712 hr) of speech. The dataset contains 4.7 million time-aligned word tokens and over 16 million phonological segments, accompanied by detailed speaker metadata. Findings / Conclusions: MuHSiC demonstrates that large-scale bilingual speech corpora can be constructed with both sociolinguistic breadth and phonetic detail. Its design ensures reliable alignment, replicable acoustic analysis, and compatibility with morphosyntactic and discourse-level research. Originality: To date, MuHSiC is the largest open-access, linguistically annotated corpus of Spanish–English bilingual speech. Its integration of balanced bilingual recordings, phoneme-level segmentation, and large-scale acoustic data distinguishes it from existing corpora. Significance / Implications: MuHSiC provides an unprecedented empirical foundation for research on bilingual phonology, phonetics, morphosyntax, and language contact. It establishes a methodological benchmark for multilingual corpus construction and supports open, collaborative research on linguistic diversity in California and beyond.
Yazarların özeti; kaynağından alınmıştır. International Journal of Bilingualism, 2026 · DOI ↗
Ücretsiz hesapla devam et
Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.
Web'de ücretsiz devam etGoogle ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.
Telefonda:
Alan: Dilbilim ve Dil
Linguistics and LanguageSocial Sciences