Fiyatlar yükleniyor…
〽️NEUTRAL

Coinbase testi: Yeni AI modelleri daha az dolandırıcılık yakaladı

Coinbase’in tekrarlı testi, sabit bir tarama politikası altında model yükseltmelerinin dolandırıcılık tespitini zayıflatabileceğini gösterdi. Uzmanlaştırılmış Qwen3.5-9B modeli ise tespiti iyileştirirken gecikmeyi azalttı.

Coinbase’in 7.293 kullanıcıya ait 16.140 işlemi yeniden oynatarak yaptığı test, üç büyük yapay zekâ model ailesinin yeni sürümlerinin önceki sürümlere kıyasla daha az ödeme dolandırıcılığı yakaladığını ortaya koydu. Testte doğrulanmış 813 dolandırıcılık işlemi yer aldı ve karar politikası sabit tutuldu. Sonnet’in duyarlılığı 22,2 yüzde puanı düşerken GPT’nin duyarlılığı 20,7 puan, dolar ağırlıklı duyarlılığı ise 21,8 puan geriledi.

Neden önemli

Sonuçlar, daha yeni ve genel amaçlı bir modelin mevcut bir ödeme tarama sistemini otomatik olarak iyileştireceği varsayımını sorguluyor. Duyarlılık, yakalanan dolandırıcılık vakalarının payını; dolar ağırlıklı duyarlılık ise tespit edilen toplam dolandırıcılık değerinin payını ölçer. GPT daha yüksek bir kesinlik skoru elde etti ve bu skor 11,5 puan arttı. Ancak işaretlemeleri grup olarak daha isabetli hale gelirken daha fazla dolandırıcılık vakası ve değeri tespit dışı kaldı.

Geçmiş işlemlerin yeniden oynatılması, tek bir tarama düzeni içindeki model davranışını izole ediyor. Bu çalışma, test edilen sürümlerin kullanıma alınması nedeniyle müşterilerin zarar gördüğünü ortaya koymuyor. Coinbase ayrıca performans gerilemelerini tespit edebildiğini, ancak nedenlerini belirleyemediğini söyledi. Özel veri seti de bağımsız tekrarı sınırlıyor.

Piyasa etkisi

Coinbase’in sonradan eğitilmiş Qwen3.5-9B modeliyle yaptığı ayrı değerlendirme farklı bir yola işaret ediyor. Geçmiş dolandırıcılık sonuçları ve deterministik ödüllerle uzmanlaştırılan model, dört dolandırıcılık tespit metriğinin tamamında Opus 4.5’i geçti. F1 skoru 9,6 yüzde puanı, dolar ağırlıklı duyarlılık ise 35,4 puan arttı.

Üretim ölçümleri, özel model için uçtan uca istek gecikmesinin medyanını 0,683 saniye olarak gösterdi. Opus 4.5’te bu süre 1,515 saniyeydi ve göreli azalma %55 oldu. Coinbase, her adayın gerçek karar düzeni içinde test edilmesini, ardından komutların, eşiklerin, gecikmenin, güvenilirliğin ve maliyetin ayrı ayrı değerlendirilmesini öneriyor.

Sıkça sorulan sorular

  1. Coinbase ödeme dolandırıcılığı testinde kaç işlem denedi?

    Test, 7.293 kullanıcıya ait 16.140 işlemi ve 813 doğrulanmış dolandırıcılık işlemini kapsadı.

  2. Coinbase’in testinde duyarlılığı en fazla düşen yapay zekâ modeli hangisiydi?

    Sonnet’in duyarlılığı 22,2 yüzde puanı düştü. GPT’nin duyarlılığı 20,7 puan, Opus’un duyarlılığı ise 0,8 puan geriledi.

  3. GPT’nin daha yüksek kesinliği dolandırıcılık taramasını iyileştirmeye neden yetmedi?

    GPT’nin kesinliği 11,5 yüzde puanı arttı, ancak duyarlılığı ve dolar ağırlıklı duyarlılığı düştü. İşaretlemeleri daha isabetli hale gelirken daha fazla dolandırıcılık vakası ve değeri tespit edilemedi.

  4. Uzmanlaştırılmış Qwen3.5-9B modeli nasıl performans gösterdi?

    Ayrı bir değerlendirmede Qwen3.5-9B, dört dolandırıcılık tespit metriğinin tamamında Opus 4.5’i geçti. F1 skoru 9,6 puan, dolar ağırlıklı duyarlılığı ise 35,4 puan arttı.

  5. Coinbase ödeme tarama modelini yükseltmeden önce ne önerdi?

    Coinbase, aday modelin gerçek karar düzeni içinde test edilmesini, ardından komutların ve eşiklerin gecikme, güvenilirlik ve maliyetle birlikte ayrı ayrı değerlendirilmesini önerdi.

Kaynak atıf
Şuradan derlenmiştir CryptoSlate · Doğrulanmış · Son güncelleme 1s önce
Orijinali aç →