İçeriğe geç
NEBİLİM AĞI ÇEVRİMİÇİ30.09.2026 · BİLİM, EVREN & TEKNOLOJİ
NeBilim.net

Her cevap,
yeni bir soru açar.

OBSERVATION / 724

Vienna Üniversitesi’nden veri setlerindeki gizli anomalileri ortaya çıkaran istatistiksel yöntem

Vienna Üniversitesi'nde farmakokimya uzmanı Johannes Kirchmair önderliğinde bir araştırma ekibi, bilimsel veri setlerindeki gizli anomalileri tespit...

Vienna Üniversitesi’nde farmakokimya uzmanı Johannes Kirchmair önderliğinde bir araştırma ekibi, bilimsel veri setlerindeki gizli anomalileri tespit etmeyi sağlayan yeni bir istatistiksel yöntem geliştirdi. Yöntem, büyük veri setlerine otomatik olarak uygulanabildiği için araştırmacıların yakından incelenmesi gereken veri kaynaklarını belirlemesini kolaylaştırıyor. Veriye dayalı araştırmaların kalitesini yükselten ve güvenilir yapay zeka uygulamalarının gelişimini destekleyen yaklaşım, Christian Doppler Laboratuvarı kapsamında yürütülen çalışmanın ürünüdür.

Modern bilimsel yöntemler giderek daha hacimli veri miktarlarına dayanıyor. İlaç keşfi gibi alanlarda milyonlarca deney ölçümü veri tabanlarından toplanıp yeni ilaçların keşfi ve geliştirilmesini desteklemek için yapay zeka modellerine aktarılıyor. Bu süreçte veri kalitesi kritik önem taşıyor: Veri toplama, işleme veya bütünleştirme aşamalarında ortaya çıkan hatalar, ardından gelen analiz, bulgu ve araştırmaları yavaşlatabilir hatta geçersiz kılabilir. Ancak büyük veri setlerinin sistematik olarak denetlenmesi araştırmacılar için önemli zorluklar oluşturuyor.

Benford yasasına dayanan yöntem

Vienna Üniversitesi İlaç Bilimleri Bölümü’ndeki Biyobilimler alanındaki Christian Doppler Laboratuvarı for Molecular Informatics’ten Uday Abu-Shehab, Matthias Welsch ve Kirchmair, anormal veri setlerini otomatik olarak belirlemeyi hedefleyen bir yöntem geliştirdi. Yöntemin kalbinde, Benford yasası yer alıyor. Bu yasa, birçok doğal veri setinde belirli basamakların diğerlerine göre ilk basamak olarak daha sık göründüğünü açıklıyor. Bu kalıptan ciddi sapmalar, düzensizliklerin veya olası kalite sorunlarının işareti olabilir.

Araştırmanın bulguları, Patterns adlı dergide yayımlandı.

Veri setleri için bir süzgeç

“Yöntemimiz verinin kusurlu veya uydurulmuş olduğuna dair doğrudan bir kanıt sunmuyor,” diyor Kirchmair. “Bunun yerine, büyük koleksiyonlar içinden yakından incelenmesi gereken veri setlerini süzmeye yardımcı oluyor. Bu da araştırmacıların dikkatini özellikle potansiyel sorunlu veri setlerine yöneltmelerini sağlıyor.”

Araştırmacıların veri setlerini önceliklendirmeine yardımcı olmak için ekip, “Simülasyon Temelli Benfordluluk Tahmini” (SBBE) adlı yöntemi geliştirdi. Geniş kapsamlı bilgisayar simülasyonlarını Bayesian istatistikleriyle birleştiren yöntem, hem veri kalitesi değerlendirmesi hem de buna bağlı belirsizlik tahmini sunuyor. Bu sayede veri setlerinin önceki yöntemlere göre çok daha etkili şekilde karşılaştırılması mümkün oluyor.

“Mevcut yaklaşımların çoğunda, kalite analizlerinin sonuçları mevcut veri noktası sayısına büyük ölçüde bağlıdır,” diyor Abu-Shehab. “Yöntemimiz bu belirsizliği açık şekilde hesaba katarak farklı büyüklükteki veri setleri arasında adil karşılaştırmalar yapmayı sağlıyor. Bu da sonuçları önemli ölçüde daha sağlam hale getiriyor.”

NeBilim haberlerini Google News üzerinde keşfet

Biyaktivite veri tabanlarıyla test

Yöntemi değerlendirmek için araştırmacılar, biyaktivite verileriyle bir deneme çalışması yürüttü. Biyaktivite verileri, biyoaktif bileşiklerle hedef proteinleri arasındaki etkileşimlerin gücünü tanımlar ve modern ilaç keşfinde temel önem taşır. Analiz, büyük biyaktivite veri tabanlarının genel olarak yüksek veri kalitesine sahip olduğunu ortaya koydu. Yöntem aynı zamanda belirli veri setlerinde olağandışı istatiksel özellikler de ortaya çıkardı. Araştırmacılar, bu özellikleri deney tasarımının, veri işlemenin veya veri düzenlemesinin belirli yönlerine bağlayabildi.

Bilimsel veri koleksiyonlarının kalitesini güvence altına alıyor

“Otomatik kalite kontrol araçları, özellikle veriye dayalı araştırmalar için giderek daha önemli hale geliyor,” diyor Welsch. “Amacımız, araştırmacıların anomalileri erken aşamada belirlemeleri için kolay kullanılabilir bir araç sunmak ve bilimsel veri koleksiyonlarının kalitesini daha da geliştirmek.”

SBBE’nin belirli bir araştırma alanıyla sınırlı olmaması nedeniyle yazarlar, yöntemin birçok başka alanda da potansiyel taşıdığını vurguluyor. Nümerik veri ne kadar büyük hacimlerde üretiliyorsa, yöntem gizli düzensizlikleri ortaya çıkarmada ve bilimsel kararların ile yapay zeka uygulamalarının dayanağını güçlendirmede yardımcı olabilir.

“Yöntemimiz verinin kusurlu veya uydurulmuş olduğuna dair doğrudan bir kanıt sunmuyor. Bunun yerine, büyük koleksiyonlar içinden yakından incelenmesi gereken veri setlerini süzmeye yardımcı oluyor. Bu da araştırmacıların dikkatini özellikle potansiyel sorunlu veri setlerine yöneltmelerini sağlıyor.”

Johannes Kirchmair, Vienna Üniversitesi

Geliştirilen yaklaşım, veriye dayalı araştırmaların güvenilirliğini artırmayı hedefliyor. Özellikle ilaç keşfi gibi veri yoğun alanlarda, hatalı veya şüpheli veri kaynaklarının erken aşamada işaretlenmesi, harcanan zaman ve kaynağın verimli kullanılmasına katkı sağlayabilir. Yöntemin belirsizlikleri de hesaba katması, farklı büyüklükteki veri setlerinin birbirleriyle adil şekilde karşılaştırılmasına olanak tanıyor.

Araştırma ekibi, yöntemin farklı disiplinlerde de kullanılabilir olduğunu vurguluyor. Hacimli nümerik verinin üretildiği her alanda gizli düzensizlikleri ortaya çıkaran yöntem, bilimsel kararların ve yapay zeka uygulamalarının dayanağını sağlamlaştırmaya yardımcı olabilir.

“Simülasyon temelli Benfordluluk tahmini kullanan, ilaç keşfi verilerinde anomali tespiti için bir Bayesian çerçevesi,” Patterns (2026). DOI: 10.1016/j.patter.2026.101683.

İlginizi Çekebilir: Ekvador Sahillerinde Plastik Kirletme: 12.800 Metre Derinlikte Okyanus Tabanına Yayılan Çöp, Plastiğin Derin Sulara Uzanması →
Kaynak: PHYS ↗
Forumda sor / tartış
AÇIK LABORATUVAR / TARTIŞMA

1 yorum

Fikrinizi bir kaynak, soru veya yapıcı karşı görüşle geliştirin.

Tartışmaya katıl

E-posta adresiniz yayımlanmaz. Zorunlu alanlar * ile işaretlidir.

SEARCH / 001

En az 3 karakter yazın.

ATLAS / NAVIGATION

Bilgi alanları