PofoliaPofolia ile paylaşıldı

PLoS ONE· 2026Q1

İngilizce-Farsça çapraz dil intihal tespiti: Çok dilli derin öğrenme yaklaşımı

English-Persian cross-language plagiarism detection: Multilingual deep learning approach

Sara Ansar, Marzieh Zarinbal, Azadeh Mohebi

Kısa özet

İnce ayarlanmış bir Lojistik Regresyon modeli, İngilizce-Farsça çapraz dil intihalini tespit etmede %96 doğruluk elde ederek karmaşık derin öğrenme modellerini geride bıraktı.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Ana noktalar

  • İnce ayarlanmış bir Lojistik Regresyon modeli, İngilizce-Farsça çapraz dil intihal tespitinde %96 doğruluk elde etti.
  • Yaklaşım, dilsel mesafeleri ölçmek için BAAI/bge-m3 gömmelerini ve kosinüs benzerliğini kullanır.
  • Optimize edilmiş LR modeli, diğer sınıflandırıcılara kıyasla doğruluğu %89'dan %96'ya (%0,05 < p) yükseltti.
  • Yüksek kaliteli gömmeler, karmaşık derin öğrenme modellerine gerek kalmadan düşük kaynaklı bağlamlarda tespiti geliştirir.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Özet (abstract)

Cross-lingual plagiarism detection (CLPD) remains a critical challenge in Natural Language Processing, particularly for low-resource language pairs where translation and paraphrasing obscure source materials. This study introduces a robust framework for Persian-English CLPD by integrating state-of-the-art sentence representations with optimized machine learning classifiers. We utilized the BAAI/bge-m3 model to generate high-dimensional embeddings, employing cosine similarity to measure contrastive linguistic distances. To evaluate classification performance, we compared various architectures, including XGBoost, LSTM, and Logistic Regression (LR), across three categories: Exact, Semi-Exact, and Different. While deep learning and ensemble methods were initially considered, experimental results on an expanded dataset demonstrated that a fine-tuned LR model provided superior stability and generalization. The optimized LR approach significantly increased classification accuracy from 89% to 96% (p < 0.05). These findings suggest that high-quality embeddings can enhance detection performance in low-resource contexts without the computational overhead of complex architectures. To ensure transparency and reproducibility, our dataset and source code are available on GitHub.

Yazarların özeti; kaynağından alınmıştır. PLoS ONE, 2026 · DOI ↗

ÇıkarımlarPremium
Makaleye SorÜcretsiz hesapla

Ücretsiz hesapla devam et

Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.

Web'de ücretsiz devam et

Google ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.

Telefonda:

Alan: Güvenlik Araştırmaları

Safety ResearchSocial Sciences