PLoS ONE· 2026Q1
İngilizce-Farsça çapraz dil intihal tespiti: Çok dilli derin öğrenme yaklaşımı
English-Persian cross-language plagiarism detection: Multilingual deep learning approach
- 0atıf
- Q1SCImago
- 2026yıl
Kısa özet
İnce ayarlanmış bir Lojistik Regresyon modeli, İngilizce-Farsça çapraz dil intihalini tespit etmede %96 doğruluk elde ederek karmaşık derin öğrenme modellerini geride bıraktı.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Ana noktalar
- İnce ayarlanmış bir Lojistik Regresyon modeli, İngilizce-Farsça çapraz dil intihal tespitinde %96 doğruluk elde etti.
- Yaklaşım, dilsel mesafeleri ölçmek için BAAI/bge-m3 gömmelerini ve kosinüs benzerliğini kullanır.
- Optimize edilmiş LR modeli, diğer sınıflandırıcılara kıyasla doğruluğu %89'dan %96'ya (%0,05 < p) yükseltti.
- Yüksek kaliteli gömmeler, karmaşık derin öğrenme modellerine gerek kalmadan düşük kaynaklı bağlamlarda tespiti geliştirir.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Özet (abstract)
Cross-lingual plagiarism detection (CLPD) remains a critical challenge in Natural Language Processing, particularly for low-resource language pairs where translation and paraphrasing obscure source materials. This study introduces a robust framework for Persian-English CLPD by integrating state-of-the-art sentence representations with optimized machine learning classifiers. We utilized the BAAI/bge-m3 model to generate high-dimensional embeddings, employing cosine similarity to measure contrastive linguistic distances. To evaluate classification performance, we compared various architectures, including XGBoost, LSTM, and Logistic Regression (LR), across three categories: Exact, Semi-Exact, and Different. While deep learning and ensemble methods were initially considered, experimental results on an expanded dataset demonstrated that a fine-tuned LR model provided superior stability and generalization. The optimized LR approach significantly increased classification accuracy from 89% to 96% (p < 0.05). These findings suggest that high-quality embeddings can enhance detection performance in low-resource contexts without the computational overhead of complex architectures. To ensure transparency and reproducibility, our dataset and source code are available on GitHub.
Yazarların özeti; kaynağından alınmıştır. PLoS ONE, 2026 · DOI ↗
Ücretsiz hesapla devam et
Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.
Web'de ücretsiz devam etGoogle ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.
Telefonda:
Alan: Güvenlik Araştırmaları
Safety ResearchSocial Sciences