AÖF Soru Bankası

Veri MadenciliğiÜnite 7 Özeti

Kümeleme Analizi

Kümeleme Yöntemleri Kümeleme Analizi Kavramı Kümeleme yöntemleri; uzaklık (distance), benzerlik Çok değişkenli istatistik yöntemleri arasında yer alan, çok (similarity) ya da farklılık (dissimilarity) matrisinden sayıda ve karmaşık yapıdaki veri setinde verileri yararlanarak birimleri ya da değişkenleri kendi içinde gruplandırmak ve oluşan grupları karşılaştırmak amacıyla homojen ve kendi aralarında heterojen uygun kümelere kullanılan kümeleme analizi, uygulaması kolay ve ayırırken, kümeleri belirlemede izledikleri yaklaşımlara sonuçlarının anlaşılır olması nedeniyle sıkça başvurulan göre iki temel alt gruba ayrılırlar. Bunlar; Aşamalı bir yöntemdir. Veri madenciliğinin bir alt türü olan bu kümeleme yöntemleri (Hierarchical Cluster Analysis yöntemde veriler uzaklık ve benzerliklerine göre kümelere Methods) ve Aşamalı olmayan kümeleme yöntemleri ayrılmakta, kümeler arasındaki farklılıklar ve bu (Nonhierarchical Cluster Analysis Methods) olarak ele farklılıkların nedenleri üzerinde durulmaktadır. Analiz alınmaktadır. Her iki yöntemde de ortak amaç kümeler sonucunda birbirine en çok benzeyen birimler aynı arasındaki farklılıkları ve kümeler içi benzerlikleri en kümelerde toplanmaktadır. Bu tür kümeler kendi içlerinde yüksek düzeye çıkarmaktır. homojen farklı kümelerle de heterojen bir yapıya sahip olurlar. Kümeleme analizinin temel amacı, hangi kümeye Aşamalı Kümeleme Yöntemleri ait olduğu bilinmeyen bir grup verinin, sınıflandırılarak Aşamalı kümeleme yöntemleri, birimleri/değişkenleri anlamlandırılmasıdır. Dolayısıyla kümeleme analizi birbirleri ile farklı aşamalarda bir araya getirerek ardışık birimleri ya da değişkenleri temel özelliklerine göre biçimde kümeler belirlemeyi ve bu kümelere girecek sınıflandırmak için kullanılmaktadır. Kısaca kümeleme elemanların hangi uzaklık (ya da benzerlik) düzeyinde analizinin genel amacının benzer olanları farklı olandan küme elemanı olduğunu belirlemeye yönelik yöntemlerdir. ayırmak olduğu ifade edilebilir. Aşamalı kümeleme yöntemleri, veri matrisinde bulunan

Kümeleme analizi, çok değişkenli ham veri setindeki birimlerin ya da değişkenlerin analizin başlangıç gözlemlerin sahip oldukları özellikler bakımından doğal aşamasında kaç küme oluşturduğuna ve küme grup yapılarını belirlemeyi, homojen alt gruplara ayırmayı elemanlarını belirlemede başlangıçta hangi kriterin sağlayan istatistiksel yöntemler topluluğudur. Sağlık, seçildiğine göre iki temel gruba ayrılır. Bunlar; Birleştirici ziraat, biyoloji, psikoloji, sosyoloji, arkeoloji gibi aşamalı kümeleme yöntemleri (Agglomerative gözlemlerin sınıflandırılmasına ihtiyaç duyulan pek çok hierarchical clustering prosedures) ve Ayırıcı aşamalı bilim dalının faydalandığı uygulamalarda sıklıkla kümeleme yöntemleridir (Divisive hierarchical clustering kullanılan bir yöntemdir. Kümeleme analizi, diğer çok prosedures).

değişkenli analiz yöntemi olan diskriminant analizinde Birleştirici Aşamalı Kümeleme Yöntemleri olduğu gibi tahmin amaçlı kullanılmamakta ve faktör analizinde olduğu gibi de varsayımları bulunmamaktadır. Birleştirici aşamalı kümeleme yöntemleri, başlangıçta veri setinde bulunan tüm birimlerin farklı birer küme Kümeleme analizi genellikle dört aşamada oluşturduğu kabul edilerek analize başlanır. Birleştirici uygulanmaktadır. Bunlar; veri matrisinin oluşturulması, aşamalı kümeleme yöntemleri, birimlerin oluşturduğu benzerlik veya uzaklık matrislerinin hesaplanması, kümelerin şekillenmesinde, birbirleri ile hangi aşamada ve kümelemede esas alınacak yöntemlerin belirlenmesi ve hangi benzerlik düzeyinde ortak özelliklere sahip kümeler elde edilen sonuçların yorumlanmasıdır. oluşturduklarını göstermeleri açısından yaygın olarak kullanılan kümeleme yaklaşımıdır. Uzaklık ve Benzerlik Ölçüleri Kümeleme analizinde oluşturulan kümeler, birbirine yakın Ayırıcı Aşamalı Kümeleme Yöntemleri

birimlerin ya da değişkenlerin oluşturdukları grup olarak Ayırıcı aşamalı kümeleme yöntemlerinde, başlangıçta veri tanımlanabilir. Kümeleme analizinde birim ya da setinde bulunan tüm birimlerin bir küme olduğu değişkenler arasındaki uzaklıkları hesaplamak için en sık varsayılarak analize başlanır. Diğer bir ifadeyle işlem, kullanılan uzaklık ölçüsü Öklid uzaklığıdır. Öklid uzaklığı birleştirici aşamalı kümeleme yönteminde olan aşamaların iki obje arasındaki benzerliği ölçmede en yaygın tam tersine işler. kullanılan uzaklık ölçüsü olup iki obje arasına çizilecek bir doğrunun uzunluğunu temel alır. Bu uzaklık ölçüsü Aşamalı Olmayan Kümeleme Yöntemleri

dışında birimler ya da değişkenler arasındaki uzaklık Birimlerin kendi içinde homojen ve kendi aralarında değerlerinden faydalanarak kümelerin oluşturulmasında heterojen olan kümelere ayrılmasını hedefleyen ve elde kullanılan farklı uzaklık ölçüleri de vardır. Bunlar; Karesel edilen kümeler aracılığı ile alt toplum yapılarına ilişkin Öklid uzaklığı, Pearson ve Karesel Pearson uzaklığı, tahmin yapmayı amaçlayan yöntemlerdir. Aşamalı Manhattan (City-Blok) Uzaklığı, Korelasyon katsayısı ve kümelemede hem birimler hem de değişkenler korelasyon uzaklığı, Açısal uzaklık (cosine measure), birbirleriyle farklı benzerlik düzeylerinde kümeler Binary Öklid uzaklığı, Gamma benzerlik ölçüleri gibi. oluştururken, aşamalı olmayan kümeleme yöntemlerinde sadece birimler kümelenmektedir. Örneğin; kabul gören sağlık veya ekonomik göstergeler bakımından ülkeler 4 farklı kümeye ayrılmak istenilebilir. Bu kümeler ise, geri


kalmış, az gelişmiş, gelişmekte olan, gelişmiş ülkeler olarak isimlendirilebilir.

Aşamalı kümeleme yöntemleri daha çok küçük veri setleri için uygundur. Buna karşılık aşamalı olmayan kümeleme yöntemleri ise daha çok büyük veri setlerine uygulanmaktadır. Bunun nedeni aşamalı olmayan kümeleme yöntemlerinde başlangıçta benzerlik ve uzaklık matrislerinin hesaplanmamasıdır. Ayrıca aşamalı olmayan kümeleme yöntemleri veri setinde bulunan aşırı uç değerlerden daha az etkilenmektedir. Aşamalı olmayan Kümeleme Yöntemleri arasında en yaygın kullanılan yöntem K-ortalamalar kümeleme (k-means clustering, MacQueens’ Method) yöntemidir. Bu yöntem birçok istatistik hazır yazılımda bulunmaktadır. Bunun dışında Medoid kümeleme ve Fuzzy kümeleme gibi aşamalı olmayan kümeleme yöntemleri de bulunmaktadır.

R Programında K-Ortalamalar Kümeleme Yöntemi Uygulaması ve Sonuçlarını Görmek

Kümeleme analizi uygulamalarının yapılması ve yorumlanması hakkında bilgi ve beceri kazanmak araştırmacıların işlerini oldukça kolaylaştırmaktadır. Bu işlem için bilişim teknolojilerinin kullanımı oldukça önemlidir. Bilgisayar ve konu ile ilgili yazılım kullanımını bilmek, verileri analiz etmek, sonuçları yorumlayabilmek ve rapor hâline getirebilmek hem zaman hem de kaynak kullanımı bakımından uygulamacılara avantaj sağlamaktadır.

Bu ünitenin sorularını uygulamada çözŞıklar, doğru cevaplar ve süreli sınav modu AÖF Soru Bankası uygulamasında