Yapay Zeka mı Doktorlar mı: Çalışmalar Ne Diyor
Yapay zekanın doktorları geçtiğini bildiren çalışmaların çoğu, tek bir algoritmayı tek bir dar görevde, kendisiyle aynı sınırlı girdiyi alan hekimlerle karşılaştırır: genellikle özenle seçilmiş bir görüntü kümesi ya da bir metin bloğu. Bu koşullarda yapay zeka çoğu zaman uzmanlarla aynı seviyede çıkar veya onları geçer, ve bunu 2016'dan beri defalarca yaptı. Bir doktorun gerçekten çalıştığı koşullarda, yani anamnez alırken, hastayı muayene ederken, veri eksikken ne yapacağına karar verirken ve yanılmanın sonucunu taşırken, bu karşılaştırma neredeyse hiç yapılmadı.
"Yapay zeka mı doktor mu" çalışması aslında neyi karşılaştırır
Gördüğün her manşet üç tasarımdan birinden geliyor. Geriye dönük veri kümesi çalışması, modeli cevabı önceden bilinen kayıtlı görüntüler veya dosyalar üzerinde çalıştırır. Okuyucu çalışması, küçük bir hekim paneline aynı kayıtlı vakaları verir ve puanları karşılaştırır. İleriye dönük çalışma ise sistemi canlı klinik akışa sokar ve hastalara ne olduğunu ölçer. İlk ikisi yaygın ve ucuz. Üçüncüsü nadir ve pahalı, ve gerçek pratik hakkında sana bir şey söyleyen tek tasarım o.
Bu tasarımlar arasındaki uçurum belgeli. The Lancet Digital Health'te 2019'da yayımlanan bir sistematik derlemede Liu ve arkadaşları, tıbbi görüntülemede derin öğrenme üzerine yirmi binden fazla makaleyi taradı ve yalnızca çok azının, yirmiden azının, algoritmayla sağlık profesyonellerini aynı test örneği üzerinde karşılaştırdığını buldu. Karşılaştıranlarda performans genel olarak benzerdi. BMJ'de 2020'de Nagendran ve arkadaşlarının yaptığı derleme aynı literatüre baktı ve şu sonuca vardı: randomize çalışmalar neredeyse yok, çalışmaların çoğu yüksek yanlılık riski taşıyor, ve özetlerdeki iddialar tablolardaki kanıtın önünde koşuyor.
Yani "yapay zeka doktorları geride bıraktı" cümlesini okuduğunda, dürüst çevirisi genellikle şu: "bu veri kümesinde, bu kadar okuyucuya karşı, bu tek görevde."
Görev görev, yan yana
| Görev | Yapay zeka lehine en güçlü kanıt | Hekimin hâlâ önde olduğu yer |
|---|---|---|
| Retina fotoğrafından diyabetik retinopati | Gulshan ve ark., JAMA 2016: doğrulama kümelerinde duyarlılık ve özgüllük bir göz hekimi paneliyle aynı seviyede veya üstünde | Görüntüsü değerlendirilemeyen ya da kliniğe ulaşamayan hastada bundan sonra ne olacağına karar vermek |
| Cilt lezyonu sınıflandırması | Esteva ve ark., Nature 2017: bir sinir ağı, seçilmiş görüntü kümelerinde uzman dermatologlarla aynı düzeyde çıktı | Eğitim verisinde az temsil edilen cilt tonları, vücut bölgeleri ve kameralardaki lezyonlar |
| Mamografi taraması | McKinney ve ark., Nature 2020: geriye dönük İngiltere ve ABD verisinde okuyuculardan daha az yanlış pozitif ve yanlış negatif | Modelin hiç doğrulanmadığı bir popülasyonla karşılaştığı canlı tarama programları |
| Metin üzerinden tanısal görüşme | Google'ın AMIE çalışması, Nature: simüle hastalarla sohbet üzerinden yürütülen randomize çalışmada birinci basamak hekimlerinden daha yüksek tanı doğruluğu | Muayene gerektiren her karşılaşma, ya da asıl önemli ayrıntıyı söylemeyen gerçek bir hasta |
| Büyük dil modeli destekli tanısal akıl yürütme | Goh ve ark., JAMA Network Open 2024: tek başına çalışan model hekimlerden yüksek puan aldı | Modeli eline alan hekimler, alışıldık kaynakları kullanan hekimleri açık biçimde geçemedi |
Tablodaki en ilginç sonuç son satır, ve en az haber olan da o. Model tek başına doktorları geçiyorsa, ama doktor artı model tek başına doktoru geçemiyorsa, darboğaz ham doğruluk değil demektir. Darboğaz, bir hekimin kendi üretmediği bir cevabı ne zaman kabul edeceğine nasıl karar verdiğidir.
Hekimlerin hâlâ açık ara önde olduğu yerler
Verinin hiç içermediği vakalar. Bir modelin performansı, eğitim dağılımının bir özelliğidir. Onu farklı bir cihaza, farklı bir popülasyona ya da hiç görmediği bir hastalık sıklığına taşı, doğruluk hiçbir uyarı sinyali vermeden düşebilir. Hekimler daha yumuşak bir eğimle bozulur, çünkü bir şeyin tanıdık olmadığını fark edip üst basamağa yönlendirebilirler.
Görüntü var olmadan önceki her şey. Birisi bu hastanın görüntülemeye ihtiyacı olduğuna, bu göğüs ağrısının bu gece araştırılmaya değer olduğuna karar verdi. Bu triyaj adımı tıbbın büyük bölümüdür, ve karşılaştırma testlerinin atladığı kısım tam da odur.
Model senin vakandan öğrenmiyor. Sahaya çıkmış bir tanı sistemi, donmuş ağırlıklar üzerinde çıkarım yapıyor. Bu sabah gördüğü hastayı hatırlamaz, yanıldığında kendini güncellemez. Bu, bir hekimin bir kariyer boyunca muhakeme kurma biçiminin tam tersidir. Bu ayrım kafanda net değilse, bir performans iddiasını daha okumadan önce öğrenme ile çıkarım arasında ne değiştiğini anlamaya değer.
Yeniden üretilebilirlik. 2020 tarihli meme kanseri taraması makalesi, Nature'da Haibe-Kains ve arkadaşlarından resmi bir yanıt aldı: kod ve model ayrıntıları paylaşılmadığı için sonuç bağımsız olarak doğrulanamazdı. Bu itiraz literatürün büyük bir bölümü için geçerli.
Sorumluluk. Hiçbir çalışma, bir sonucun hesabını verebilecek bir sistem üretmiş değil.
Hangisine, ne için güveneceksin
Tek ve iyi tanımlanmış bir sinyalin yüksek hacimli taraması için, hem de modelin doğrulandığı veriye benzeyen veri üzerinde, yapay zeka lehine kanıt gerçekten güçlü. İkinci bir otomatik okuma, günün kırkıncı görüntüsünde saat 16.00'da yorulmuş bir gözün kaçırdığını yakalayabilir.
Ayrışmamış bir şikayet için, yani "üç haftadır kendimi kötü hissediyorum" diye gelen türden bir sorun için kanıt hekimden yana, hem de az farkla değil. Mevcut literatürde hiçbir çalışma bir modeli işin tamamı üzerinde sınamıyor.
Kendi sağlığın için, seni muayene edebilen, tetkiki isteyebilen ve sonucu takip edebilen kişi doktordur. Bir sohbet botu randevu öncesi sorularını düzenlemene yardım edebilir. Randevunun yerini tutamaz, ve bir çalışmanın özetini randevuyu atlamak için izin belgesi gibi okumak buradaki en pahalı hatadır.
Bir sonraki manşeti nasıl okursun
- Görevi bul. Tek hastalık, tek görüntüleme yöntemi, tek ikili karar mı? O zaman iddia o görev hakkındadır, tıp hakkında değil.
- Karşılaştırma grubunu bul. Bir okuyucu çalışmasındaki altı okuyucu "doktorlar" demek değildir.
- İnsanların aynı bilgiye sahip olup olmadığını sor. Klinik öyküsü kaldırılmış görüntülere bakan radyologlar tek elleri bağlı çalışıyor demektir.
- Dış doğrulama var mı bak. Model, eğitim kümesinin dışındaki bir kurumun verisinde hiç test edilmediyse, o sayı bir tavan değeridir, bir öngörü değil.
Bu makaleleri okuyan öğrenciysen
Bir yöntem bölümünü okumakla, aynı tartışmayı üç hafta sonra sınavda yeniden kurabilmek aynı şey değil. Roediger ve Karpicke'nin 2006 deneylerinde, materyal üzerinde kendini test eden öğrenciler, tekrar tekrar okuyanlara kıyasla belirgin biçimde daha fazlasını akılda tuttu, üstelik o anda tekrar okumak daha verimli hissettirmesine rağmen. Bunun pratik hali şu: makaleyi kapat ve neyin neyle karşılaştırıldığını, sınırın ne olduğunu ezberden yaz. Kendi ders notlarını ve makaleleri cevaplamak zorunda olduğun sorulara çevirmek, aynı mekanizmanın ölçeklenmiş hali. Bunu elle deneme sınavı hazırlayarak da yapabilirsin, genel bir soru bankası yerine gerçekten çalıştığın materyalden soru üreten Qora gibi bir araçla da.
Sık sorulan sorular
Yapay zeka bir çalışmada gerçekten doktorları geçti mi?
Evet, birden fazla çalışmada, dar görevlerde geçti. Diyabetik retinopati tespiti, cilt lezyonu sınıflandırması ve mamografi taramasının hepsinde, modelin hekim karşılaştırma grubuyla aynı seviyeye geldiği ya da onu aştığı yayımlanmış sonuçlar var. Hepsi seçilmiş veri kümeleri üzerindeydi ve çoğu geriye dönüktü.
Bu sonuçlar gerçek hastanelerde de geçerli mi?
Çoğu zaman aynı düzeyde değil. Hem The Lancet Digital Health'teki hem BMJ'deki derlemeler, ileriye dönük çalışmaların nadir olduğunu ve yayımlanmış karşılaştırmaların çoğunun yüksek yanlılık riski taşıdığını buldu. Özenle hazırlanmış bir test kümesinde ölçülen performans, en iyi ihtimaldir, beklenen sonuç değil.
Yapay zeka doktorların yerini alabilir mi?
Mevcut kanıta göre hayır. En çok şey anlatan sonuç, 2024'teki randomize çalışma: büyük dil modeli verilen hekimler, alışıldık kaynakları kullanan hekimlerden açık biçimde daha iyi sonuç alamadı, oysa model tek başına daha yüksek puan almıştı. Klinik işe entegrasyon, doğruluktan ayrı ve henüz çözülmemiş bir problem.
Belirtilerim için yapay zeka sohbet botu kullanmalı mıyım?
Terimleri anlamak, sorularını hazırlamak ya da elindeki bir raporu çözmek için makul. Ama bu bir tanı değil, seni muayene edemez, ve senin vakanla ilgili neyi bilmediğini bilmesinin hiçbir yolu yok.
Kısa hali şu: yapay zeka belirli ve sınırları iyi çizilmiş tanı görevlerinde gerçekten kazandı, ve bu kazanımlar hem gerçek hem işe yarar. Gösterilemeyen şey, işin bütününde üstünlük, çünkü iş, çalışmaların dışarıda bıraktığı kısımları da içeriyor. Bir dahaki sefere akışında böyle bir sonuç gördüğünde, fikir kurmadan önce üç şeyi bul: hangi tek görev ölçüldü, kimin verisinde ölçüldü, ve karşılaştırmanın öbür tarafında kaç hekim duruyordu.