Case studies
Küresel yapay zeka geliştiricisi için Türkçe veri ve model hizalama
Modelleri Türkçede düşük performans gösteren büyük bir yapay zeka geliştiricisi için, morfolojik yargı için işe alınmış bir iş gücü ve hata taksonomisiyle değerlendirme skorları iyileştirildi.
The challenge
Müşterinin modelleri Türkçeyi belirgin daha kötü işliyordu ve değerlendirme seti nedeni tam olarak gösteriyordu: morfoloji. İngilizce için ayarlı tokenizasyon anlamlı birimleri parçalıyor, üretilen metin ek uyumu hataları gösteriyordu. Önceki tedarikçiler, anadili konuşmayanlara kabul edilebilir görünen ama değerlendirmede başarısız olan veri üretmişti.
What Corpshore did
Türk dili ve edebiyatı, dilbilim, çeviri ve hukuk mezunlarından oluşan, olağanüstü yüksek dilsel çıtalı dağıtık bir Türk iş gücü kurduk. Program dört fazda ilerledi. Teknik olarak esaslı katkı hata taksonomisiydi: anotatörler çıktıları iyi veya kötü olarak değil, dilsel nedenine göre kategorilere ayırdı. Kalite bir kapı olarak yönetildi.
Results
- Dört fazda yüzlerce saat deşifre ve etiketli Türkçe konuşma ile büyük hacimde tercih verisi teslim edildi, hepsi müşteri kabulünü geçti
- Değerlendiriciler arası uyum, iki ölçek artışı boyunca eşiğin üzerinde tutuldu
- Müşteri iç değerlendirme setinde ölçülebilir iyileşme bildirdi, en büyük kazanç morfolojik isabet ve resmi register'da
- Program iki kez uzatıldı ve yapı olarak benzeyen Azerice ile Özbekçe'ye genişledi
Why it worked
Müşteri hacim alıyordu. İhtiyacı olan dilsel teşhisti. Throughput yerine morfolojik yargı için işe alım, saat başına daha pahalıydı ama değerlendirmeyi gerçekten hareket ettiren veriyi üretti.
Let us build your Türkiye team
Tell us your function, your scale and your language needs. We will come back to you within six hours.
