Vaka çalışmaları
Küresel yapay zeka geliştiricisi için Türkçe veri ve model hizalama
Modelleri Türkçede düşük performans gösteren büyük bir yapay zeka geliştiricisi için, morfolojik yargı için işe alınmış bir iş gücü ve hata taksonomisiyle değerlendirme skorları iyileştirildi.
Zorluk
Müşterinin modelleri Türkçeyi belirgin daha kötü işliyordu ve değerlendirme seti nedeni tam olarak gösteriyordu: morfoloji. İngilizce için ayarlı tokenizasyon anlamlı birimleri parçalıyor, üretilen metin ek uyumu hataları gösteriyordu. Önceki tedarikçiler, anadili konuşmayanlara kabul edilebilir görünen ama değerlendirmede başarısız olan veri üretmişti.
Corpshore ne yaptı
Türk dili ve edebiyatı, dilbilim, çeviri ve hukuk mezunlarından oluşan, olağanüstü yüksek dilsel çıtalı dağıtık bir Türk iş gücü kurduk. Program dört fazda ilerledi. Teknik olarak esaslı katkı hata taksonomisiydi: anotatörler çıktıları iyi veya kötü olarak değil, dilsel nedenine göre kategorilere ayırdı. Kalite bir kapı olarak yönetildi.
Sonuçlar
- Dört fazda yüzlerce saat deşifre ve etiketli Türkçe konuşma ile büyük hacimde tercih verisi teslim edildi, hepsi müşteri kabulünü geçti
- Değerlendiriciler arası uyum, iki ölçek artışı boyunca eşiğin üzerinde tutuldu
- Müşteri iç değerlendirme setinde ölçülebilir iyileşme bildirdi, en büyük kazanç morfolojik isabet ve resmi register'da
- Program iki kez uzatıldı ve yapı olarak benzeyen Azerice ile Özbekçe'ye genişledi
Neden işe yaradı
Müşteri hacim alıyordu. İhtiyacı olan dilsel teşhisti. Throughput yerine morfolojik yargı için işe alım, saat başına daha pahalıydı ama değerlendirmeyi gerçekten hareket ettiren veriyi üretti.
Türkiye ekibinizi kuralım
Fonksiyonunuzu, ölçeğinizi ve dil ihtiyacınızı anlatın. Altı saat içinde size dönelim.
