İçeriğe geç
Corpshore Türkiye

Vaka çalışmaları

Küresel yapay zeka geliştiricisi için Türkçe veri ve model hizalama

Modelleri Türkçede düşük performans gösteren büyük bir yapay zeka geliştiricisi için, morfolojik yargı için işe alınmış bir iş gücü ve hata taksonomisiyle değerlendirme skorları iyileştirildi.

Zorluk

Müşterinin modelleri Türkçeyi belirgin daha kötü işliyordu ve değerlendirme seti nedeni tam olarak gösteriyordu: morfoloji. İngilizce için ayarlı tokenizasyon anlamlı birimleri parçalıyor, üretilen metin ek uyumu hataları gösteriyordu. Önceki tedarikçiler, anadili konuşmayanlara kabul edilebilir görünen ama değerlendirmede başarısız olan veri üretmişti.

Corpshore ne yaptı

Türk dili ve edebiyatı, dilbilim, çeviri ve hukuk mezunlarından oluşan, olağanüstü yüksek dilsel çıtalı dağıtık bir Türk iş gücü kurduk. Program dört fazda ilerledi. Teknik olarak esaslı katkı hata taksonomisiydi: anotatörler çıktıları iyi veya kötü olarak değil, dilsel nedenine göre kategorilere ayırdı. Kalite bir kapı olarak yönetildi.

Sonuçlar

  • Dört fazda yüzlerce saat deşifre ve etiketli Türkçe konuşma ile büyük hacimde tercih verisi teslim edildi, hepsi müşteri kabulünü geçti
  • Değerlendiriciler arası uyum, iki ölçek artışı boyunca eşiğin üzerinde tutuldu
  • Müşteri iç değerlendirme setinde ölçülebilir iyileşme bildirdi, en büyük kazanç morfolojik isabet ve resmi register'da
  • Program iki kez uzatıldı ve yapı olarak benzeyen Azerice ile Özbekçe'ye genişledi

Neden işe yaradı

Müşteri hacim alıyordu. İhtiyacı olan dilsel teşhisti. Throughput yerine morfolojik yargı için işe alım, saat başına daha pahalıydı ama değerlendirmeyi gerçekten hareket ettiren veriyi üretti.

Türkiye ekibinizi kuralım

Fonksiyonunuzu, ölçeğinizi ve dil ihtiyacınızı anlatın. Altı saat içinde size dönelim.