seçtiğimiz modele göre parametrelerinin yerine konulması Giriş ile elde edilen değerdir. Sınıflandırma modeli ise, mevcut
Karar verme, karar vericinin karşılaştığı bir problem olan nitelik değerleri ile yeni bir kaydın sınıfının çözümünde olumlu bir sonuca ulaşabilmek için, problemin kestirimini yapar ve sınıflayıcı olarak adlandırılır. sunduğu birden fazla olası seçenek içerisinden seçim yapması işlemidir. Karar verme teknikleri en uygun Karar Ağaçları
kararın verilmesinde yardımcı olmak amacı ile Sınıflandırma tekniklerinden birisi de karar ağaçlarıdır. geliştirilmiş tekniklerdir. Problemde yer alan her bir nitelik için karar ağacında bir düğüm yer alır. Böylece niteliğin test edilmesi garanti Karar probleminin zaman içerisinde doğuracağı altına alınır. Bir düğümden ayrılan dallar ise o düğümdeki sonuçlardan etkilenen sorumlu kişiye karar verici adı testin tüm olası sonuçlarının her birine karşılık verilir. Karar verici için amaç, karar sürecinde önceden gelmektedir. Karar ağacının başlangıcını oluşturan ilk saptanan ve karar verici için belirgin özelliği olumlu olan düğüm, kök düğüm olarak adlandırılır. Karar ağacı bu sonuca ulaşmaktır. Çeşitli eylem seçenekleri arasından düğümden başlayarak, problemin içerisindeki tüm karar uygun olanını belirleyen kararın etkin olması ve bu kararı seçeneklerini içerecek şekilde düğümlerin mantık sırasına uygulayacak olanların arasında mümkün olduğu kadar göre eklenmesiyle tamamlanır. Son düğüm, yaprak yüksek düzeyde kabul görmesi beklenir. İyi bir karar, düğüm, diğer düğümler ise iç düğüm olarak adlandırılır. benzer problemler ile karşı karşıya kalan iki farklı Yaprak düğümlerin her biri bir sınıfı temsil eder. Kimi yöneticinin aynı seçenekler ve aynı koşullar altında aynı sınıflandırma problemlerinde basit yapılı bir karar ağacı kararı vermesi ile özdeşleştirilebilir. Karar probleminin oluşurken, problemdeki nitelik sayısına bağlı olarak karar karar vericinin karşısına çıkabilecek tüm sonuçları ya da ağacı da karmaşık bir yapıya sahip olacaktır. senaryoları gösteren grafiksel bir yardımcı araca ihtiyacı olabilir. Karar ağaçları, karar vericinin içinde bulunduğu Bir bankanın, mevcut müşterilerini kredi risklerine göre karar verme probleminde ortaya çıkabilecek tüm sınıflamak istemesi durumunda borç, gelir, statü, risk durumları ve karar vericinin karşılaşabileceği tüm seçeneklerine göre gruplaması ve örnek karar ağacı senaryoları bir arada gösterebilen bir grafiksel S.130-131’de incelenebilir. yaklaşımdır. Karar ağacının matematiksel çözümünü elde edebilmek Karar ağaçlarının bazı avantajları, için çeşitli tanımlamaların yapılmasına ihtiyaç vardır.
• Açıklanmalarının kolay olması, D = {t1, ..., tn} veritabanını göstermek üzere, her ti • İnsani karar almayı diğer yaklaşımlara göre daha ti=(ti1,ti2 ,...,tih) ise ve A = {A1, A2, ..., Ah} niteliklerini iyi yansıtması, gösteriyor iken, C = {C1, C2, ..., Cm} sınıf kümesi olarak • Grafiksel olarak gösterilebilir olması, tanımlanmış olsun. D müşteri veritabanı ile ilişkilendirilen • Uzman olmayan kişiler tarafından da kolaylıkla karar ağacı izleyen özelliklere sahip olacaktır: yorumlanabilir olması, • Her bir düğüm Ai niteliği ile etiketlendirilecektir. • Temsili değişkenlere ihtiyaç duymadan nitel • Düğümden ayrılan her bir dal, ilgili düğüm ile değişkenleri de işleyebiliyor olmalarıdır. ilişkili niteliğe uygulanabilen soru’nun yanıtlarıyla etiketlenecektir. Veri madenciliği uygulamalarında karar vericinin sıklıkla • Her bir yaprak düğüm Ci sınıfıyla etiketlenecektir. karşılaştığı problemlerden bir tanesi de sınıflandırma problemidir. Çok basit bir sınıflandırma örneği olarak, bir Karar ağaçlarını, sınıflandırma probleminin bankanın müşterilerini, müşterilerin çeşitli niteliklerini çözümlenmesinde kullanırken iki adıma ihtiyaç duyulur. (gelir durumu, statüsü, borç durumu vb.) temel alarak, Bu adımlar, kredi uygunluk durumu gibi bir nitel değişkene göre riskli, 1. Karar ağacının oluşturulması risksiz olarak iki ayrı sınıfa gruplandırılması verilebilir. 2. Veritabanında yer alan her bir kaydın (ti) Sınıflandırma problemleri, veri madenciliğinde sınıflandırmasının yapılması şeklindedir. istatistiksel veya mantıksal yaklaşıma sahip yöntemler ile ele alınabilmektedir. Örneğin, diskriminant analizi Karar ağacı oluşturulduktan sonra, her bir kayıt bu karar sınıflandırma problemine matematiksel işlemler ağacının kök düğümden başlayarak, geçtiği her yardımıyla istatistiksel bir yaklaşım sağlar iken karar düğümdeki sorunun yönlendirmesine göre bir yaprak ağaçları, evet-hayır şeklinde değerlendirilen ifadeler ve düğüme ulaşır ve böylece sınıflandırma işlemi karşılaştırma işlemleri yardımıyla mantıksal bir yaklaşım tamamlanmış olur. Bu süreçte karşılaşılabilecek en önemli sağlar. Karar ağaçları, veri madenciliğinde karşılaşılan sorun, kök ve iç düğümlerde hangi niteliklerin yer sınıflandırma problemlerinin çözümü için en sık alacağının tespit edilmesidir. Ayırma kriteri olarak öyle başvurulan mantıksal yaklaşım yöntemidir. bir nitelik seçilmelidir ki diğer nitelikler ile karşılaştırıldığında en iyi ayırıcı nitelik olmalıdır. Nitelik Sınıflandırma, bir kaydı, önceden tanımlanmış çeşitli bir kez belirlendikten sonra, kök düğümün temsil ettiği sınıflardan birine atayan bir modelin uygulanması işlemi niteliğin test sonuçlarının her biri için dallar oluşturulur. olarak tanımlanabilir. Kestirim, bir rassal değişkenin Bu ayırma işlemi, karar ağacının büyümesi, örneğin bir
düğümdeki kayıt sayısının bölünemeyecek kadar az En yüksek kazancı sağlayan nitelik, ayırıcı nitelik olarak olması veya ağaç derinliğinin araştırmacı tarafından tanımlanır. Ancak, Entropi ve Gini indeksleri gibi belirlenen bir limite ulaşması gibi bir durma kriterine indeksler belli değerleri çok sayıda bulunduran nitelikleri ulaşılana kadar devam edecektir. tercih etme eğilimindedirler. Benzer durumlarda kullanılan stratejilerden bir tanesi sadece ikili (binary) Ayırma Kriterleri ayırma yapacak şekilde testler oluşturmak veya ayırmanın Düğümün temsil ettiği, dolayısı ile ayırma işlemini en iyi ne kadar iyi olduğunu belirlemek için kullanılan kazanç şekilde gerçekleştirecek olan niteliğin seçilmesi için çeşitli oranı ölçütünü kullanmaktır. Bu ölçüt, T’deki X’in ölçüler geliştirilmiştir. Bu ölçüler, niteliğin veri tipine göre bölünme bilgisinden yararlanmaktadır. Kazanç oranı değişiklik göstermektedir. Nitel veri için Entropi İndeksi, ölçütün hesaplanması izleyen eşitlik yardımıyla yürütülür. Gini İndeksi, Sınıflandırma Hatası İndeksi ve Twoing !"#"$ç (!,!) ölçüleri kullanılır. Ek olarak Twoing ölçüsünün sıralı Kazanç Oranı(X,T)= !(!!,! ) ölçekle ölçülmüş değişkenlerin bulunduğu veri için Ordered Twoing bulunmaktadır. Nicel veriler için ise En eşitlikte, (PX,T), X değerlerinin olasılık dağılımını temsil Küçük Kareler Sapması yöntemi en sık kullanılan ölçüdür. etmektedir ve
Entropi İndeksi ile En İyi Ayırıcı Niteliğin Seçilmesi !! !! !! PX,T = , , …, } ! ! ! Entropi, bir veri yığınındaki düzensizliğin, rassallığın miktarını ölçmek için kullanılan bir ölçüdür. Veri yığını eşitliği yardımıyla hesaplanır. Bölünme bilgisi H(PX,T) ise, içinde, örneğin bankanın oluşturduğu müşteri ! !" !! H(PX,T)= - !!! . log2( ) eşitliği ile hesaplanır. veritabanındaki müşterileri sınıflayan kredi riski ! !
niteliğinde, tek bir sınıf olması durumunda, entropinin 0 S.133 - 138’da bulunan örnek incelenebilir. (sıfır) olması beklenir. Çünkü bir düzensizlikten veya rassallıktan söz edilemez. Entropisi 0 olan bir grubun tam Gini İndeksi ve Ayırıcı Niteliğin Belirlenmesi
homojen bir grup, entropisi 1 olan grubun ise tam Gini indeksi, ikili bölünmeye dayanan bir tekniktir. Bu heterojen olduğu söylenebilir. indeksin hesaplanmasında nitelik değerlerinin sola ve sağa olmak üzere iki bölüme ayrılması işlemi yürütülür. Gini Bir veri yığınının, sınıflayıcı niteliğinin alacağı değerler indeksi hesaplanması için izlenecek adımlar; C={C1, C2, ..., Cm} olmak üzere, m sınıfa ayırabilmesi için; ilgili sınıflar hakkında ortalama bilgiye ihtiyaç 1. Adım: Her nitelik değeri, sol ve sağ olmak üzere ikiye duyulacaktır. T sınıf değerlerini içeren küme iken, PT bu ayrılır, her bölüme karşılık gelen sınıf değerleri sınıfların olasılıklarını temsil etsin. Bu olasılık değerleri gruplandırılır.
!! !! !! 2. Adım: Her bir niteliğin sol ve sağ tarafta yer alan PT= , , …, } ! ! ! bölünmeleri için Ginisol ve Ginisağ değerleri hesaplanır. Bu C sınıfının T kümesindeki sayısını tespit edebilmek adımda kullanmak üzere hesaplanacak olan Gini indeks i amacıyla |C |’den yararlanılır. Bu durumda birinci sınıfın değerlerinin tespit edilmesi için izleyen eşitlikler i !! kullanılır. olasığı P1= olacaktır. T için entropi hesabı ! ! !" 2 yapılabilmesi için izleyen eşitlik kullanılır. H(T)= - Ginisol= 1- !!! ( ) ! !"#$ !!!𝑝𝑖. 𝑙𝑜𝑔2𝑝𝑖 ! !"# 2 Ginisağ= 1- !!! ( ) Entropi indeksi hesabını banka müşteri veritabanı örneği !"#ğ
için S.133 incelenebilir. Eşitliklerde, m sınıf sayısını, T bir düğümdeki örnekleri,
T hedef niteliği, hedef niteliği olmayan bir X niteliğine |Tsol| ve |Tsağ| sol taraftaki ve sağ taraftaki örnek sayılarını, bağlı olarak T1, T2, ..., Tm alt kümelerine ayrılmak Li ve Ri ise sol ve sağ tarafta yer alan i kategorisindeki istendiğinde, T’nin bir elemanının sınıfını belirleyebilmek örnek sayılarını ifade etmektedir.
için bilgiye ihtiyaç duyulur. Bu bilgi, Ti ’nin bir 3. Adım: Her bir j niteliği için, n düğümdeki örnek sayısı elemanının sınıfının belirlenmesinde gerekli olan bilginin iken, Gini indeksinin ağırlıklı ortalaması izleyen eşitlik ağırlıklı ortalaması olarak kabul edilir. Hesaplanmanın yardımıyla hesaplanır: gerçekleştirilmesi için izleyen eşitlik kullanılır. ! ! !" Ginij = ( 𝑇𝑠𝑜𝑙 . Ginisol + 𝑇𝑠𝑎ğ . Ginisağ H(X,T) = . H(T) ! !!! ! i 4. Adım: Her bir j niteliği için hesaplanan Ginij değerleri T hedef niteliğini X niteliğine göre bölerek elde edilen arasında en küçük olan seçilir, bölünme işlemi bu nitelik bilgiyi ölçmek için kazanç ölçütünden yararlanılır ve üzerinden gerçekleştirilir. hesaplama için izleyen eşitlik kullanılır. 5. Adım: Bu adıma kadar yapılan tüm işlemler, karar Kazanç(X, T) = H(T) ‒ H(X, T) ağacına yeni bir düğüm eklenemeyene kadar tekrarlanır.
Banka müşterileri veritabanı örneği borç, gelir ve statü Levene testi veya (sınıflayıcı niteliklerde) Pearson Ki- nitelikleri ele alındığında, hangi niteliğin en iyi ayırıcı Kare testi kullanılarak, girdi niteliklerinin her biri ile hedef nitelik olduğunun Gini indeksi ile hesabı S:139-140’de yani sınıf niteliğinin arasındaki birliktelik hesaplanır. Eğer incelenebilir. hedef nitelik çok terimli (multinominal) ise 2-ortalamalar kümeleme tekniği ile iki süper sınıf oluşturur. Hedef Karar Ağacı Oluşturma Algoritmaları nitelik ile en yüksek birlikteliği elde eden girdi nitelik en Sınıflandırma problemlerinde bir karar ağacının iyi ayırıcı nitelik olarak seçilir. Oluşan ağaçları budamak oluşturulması için farklı algoritmalardan yararlanılabilir. için Tenfold çapraz doğrulama metodu kullanılır. Bu algoritmalara örnek olarak ID3, C4.5, CART, CHAID, QUEST, SLIQ, SPRINT ve MARS verilebilir. Bu Karar Ağacı Budama Süreci ve Karar Ağacının algoritmalar, veri yığınını işleme şekline ve kullanılan Performansının Test Edilmesi
ayırma kriterine göre değişiklik göstermektedir. Budama bir ya da daha fazla dalı çıkartarak, karar ağacını daha basitleştirmek amacıyla, yaprak düğüm ile değiştirme ID3 algoritması en basit karar ağacı oluşturma işlemidir. Bu işlem, çıkartılmasına karar verilen dalın algoritmasıdır. Ayırma kriteri olarak kazanç ölçütünden içerdiği kayıtların, bağlı olduğu üst düğüme dâhil edilerek, yararlanılmaktadır. Karar ağacının büyümesini durdurma düğümün yaprak düğüme dönüştürülmesine dayanır. kriteri ise tüm kayıtların tek bir sınıfa ait olması veya Böylece, kestirim hata oranının, ortaya çıkan aşırı uyum kazanç ölçütünün sıfırdan büyük olmaması durumudur. sorununun giderilmesi, azaltılması ve sınıflandırma C4.5 algoritması, ID3 algoritmasının geliştirilmiş hâlidir. modelinin kalitesinin arttırılması hedeflenir. Ayırma kriteri olarak kazanç oranından Budama süreci için çeşitli yöntemler geliştirilmiştir. Bu yararlanılmaktadır. Karar ağacının büyümesini durdurma yöntemlerden bazıları maliyet karmaşıklığı, kötümser kriteri, ayrılacak olan kayıtların sayısının belirli bir eşiğin hata, hata-karmaşıklığı, kritik değer, azaltılmış hata, en altına düşmesi durumudur. C4.5 algoritmasında, karar küçük hata budama yöntemleridir. ağacının büyüme safhasından sonra, sınıflandırma hatasına dayanan budama işlemi uygulanmaktadır. Karar ağacı oluşturulurken, veritabanının bir kısmı modeli oluşturmak için kullanılırken, kalan kısım ise oluşturulan Kısaca CART olarak adlandırılan sınıflandırma ve modelin test edilebilmesi için ayrılır. Veriyi ikiye regresyon ağaçları algoritması, ikili (binary) karar ağacı ayırmanın amacı, kullanılan karar ağacı algoritmasının yapısından dolayı diğer algoritmalardan farklılık ortaya çıkardığı sınıflandırmanın test için saklanan veri ile göstermektedir. Karar ağacındaki her bir düğüm yanlızca tekrar denenerek, elde edilen sonuçlar arasında anlamlı bir iki dala ayrılır. Ayırma kriteri için Entropi, Gini ve farklılık olup olmadığının tespit edilmesidir. Bu amaca Twoing indekslerinden, karar ağacını budamak için ise yönelik olarak kullanılan tekniklerden bazıları hold-out maliyet karmaşıklığı kriterinden faydalanılır. CART tekniği, tekrarlı hold-out tekniği, çapraz-doğrulama algoritmasının önemli bir işlevi ise, yaprak düğümlerinde tekniği ve bootstrap tekniğidir. bir sınıf kestirimi yerine sayısal bir değer kestirimini içeren regresyon ağacının da oluşturulabilmesidir. Hold-out tekniği, veritabanının, araştırmacının takdirinde olan bir oranda (yarı yarıya veya 1/3’e 2/3 gibi) iki ayrık CHAID algoritması ilk olarak sayısal olmayan (ölçüm gruba bölünerek, eğitim ve test verisi olarak ele düzeyi sınıflayıcı) nitelikleri işleyebilecek şekilde alınmasına dayanır. geliştirilmiştir. CHAID algoritmasında, her girdi niteliği için, hedef niteliğe göre en az anlamlılıktaki farka sahip Tekrarlı hold-out tekniği ise hold-out tekniğinin çoklu değer çiftleri bulur. CHAID algoritmasında, anlamlı tekrarına dayanmaktadır. Toplam doğruluk, her bir olarak adlandırılan fark, istatistiksel bir testten elde edilen tekrarda elde edilen model doğruluklarının aritmetik değeri ile ölçülür. Hedef, yani sınıf nitelik sürekli ise F ortalaması olarak ifade edilir. testi, sınıflayıcı ise Pearson Ki-Kare testi, sıralayıcı Çapraz-doğrulama yönteminde ise, veritabanı iki eşit ölçekle ölçülmüş ise maksimum benzerlik oranı testinden gruba bölünür ve birinci grup eğitim verisi olurken ikinci yararlanılmaktadır. CHAID algoritmasında, her seçilen grup test verisi olarak ele alınır. Daha sonra, grupların değer çifti için elde edilen değerinin belli bir birleştirme rolleri değiştirilir. Modelin hatası, bu iki denemenin eşik değerinden daha büyük olup olmadığı kontrol edilir hataları toplamına eşittir. 2-katlı çapraz doğrulama olarak ve olumlu sonuç alınan değerler doğru birleştirilir. da adlandırılan bu yöntem, k-katlı olarak Algoritma daha sonra da birleştirilebilecek potansiyel genelleştirilebilir. Bu durumda, veritabanı eşit büyüklükte değer çiftleri aramaya devam eder. CHAID k tane gruba bölünür. algoritmasında, oluşturulan karar ağacına budama uygulanmaz ve kayıp verinin söz konusu olması Sınıflandırma ve Regresyon Ağaçlarının R durumunda hepsini tek bir geçerli kategori olarak dikkate Çözümü alarak işlem yürütülür. Sınıflandırma ve regresyon ağaçları (CART), veri QUEST algoritması, tek değişkenli ve doğrusal madenciliği sürecinde karşılaşılan sınıflandırma kombinasyon ayırmaları destekler. Her ayırma için problemlerinde oldukça sık kullanılan bir yöntemdir. İkili (sıralayıcı veya sürekli niteliklerde) ANOVA F testi, (binary) karar ağaçları oluşturulduğu için diğer
algoritmalardan ayrılmaktadır. Karar ağacındaki her bir Veritabanı Erişimi ile R’ye Veri Aktarma: Bu bağlantı, düğüm sadece iki dala ayırır. Ayırma kriteri için Entropi, Microsoft Windows işletim sisteminde yer alan ODBC Gini ve Twoing indekslerinden, karar ağacını budamak (Open Database Connectivity) bağlantı türüdür. Bu için ise maliyet-karmaşıklığı kriterinden yararlanmaktadır. bağlantı türü, farklı veritabanı sistemlerine standart CART algoritmasının önemli bir işlevi ise, yaprak teknikler ile bağlantı yapılmasını sağlar. Microsoft düğümlerinde bir sınıf kestirimi yerine sayısal bir değer Windows işletim sisteminde, var olan bağlantıları kestirimini içeren regresyon ağacı da oluşturabilmesidir. öğrenmek veya yoksa bir bağlantı yaratmak için Denetim Masası -> Yönetimsel Araçlar -> Veri Kaynakları R’ye Veri Aktarma (ODBC) menü hiyerarşisi izlenebilir. R yazılımının, R’ye veri aktarmanın birçok yöntemi mevcuttur. Bu veritabanından veri alabilmesi için bu bağlantı türü de yöntemlerden bazıları csv (comma seperated values) türü kullanılabilir. Ancak, bu işlemin gerçekleştirilebilmesi için dosya ile veri aktarımı, kopyala-yapıştır yöntemi ve ihtiyaç duyulan RODBC paketinin kurulu olması veritabanı bağlantısı ile veri aktarım yöntemidir. gerekmektedir. Paket Yükle seçeneği yardımıyla veya
csv Dosyası ile R’ye Veri Aktarma: csv dosya türü, library(RODBC) komutu yardımıyla RODBC paketi günümüz veri işleme (işlem tablosu, veritabanı vb) hafızaya yüklenebilir. Bu paketin, odbcConnect() ve uygulamalarının tümünde standart olarak kullanılan bir sqlFetch() fonksiyonları yardımı ile bağlantı kurularak, dosya türüdür. Birçok yazılım csv türü dosya oluşturma ve veritabanındaki istenen bir veri tablosu okunabilir. işleme yeteneklerine sahiptir. Herhangi bir yazılım odbcConnect() fonksiyonunun kullanımında gerekli olan kullanılarak, elinizdeki veri setinin csv dosya türünde parametreler dsn, uid ve pwd parametreleridir. Diğer kaydedilmesi gerekir. csv dosyası herhangi bir metin parametreler için R komut satırına help(odbcConnect) editörü ile bir kez açılarak, içeriğinin kontrol edilmesi komutunu yazarak yardım alınabilir. dsn parametresi yerinde olacaktır. Veritabanını csv dosya türünde sistemde kayıtlı olan veri kaynağının ismini, uid ve pwd kaydedebilmek için ilgili uygulamanın Dosya menüsünden parametreleri ise, veritabanına erişim için gerekli ise Kaydet seçeneği kullanılarak kayıt işlemi gerçekleştirilir. kullanıcı adı ve şifre değerlerini tanımlamaktadır.
S:14 Şekil 6.4 incelenebilir. Veri bağlantısı sağlandıktan sonra, sqlFetch() fonksiyonu
Aktarım için read.csv() fonksiyonundan yararlanılır. Bu yardımıyla istenen tabloya erişim sağlanır. sqlFetch() fonksiyonun kullanımında gerekli olan parametreler file, fonksiyonunun kullanımında gerekli olan parametreler header, sep ve dec parametreleridir. Diğer parametreler channel ve sqtable parametreleridir.
için R komut satırına help(read.csv) komutunu yazarak Sınıflandırma ve Regresyon Ağaçlarının rpart Paketi ile yardım alınabilir. file parametresi veri dosyasının kayıt Çözümü ortamındaki konumunu ve dosya adını, header rpart paketi içerisinde yer alan rpart() fonksiyonunda parametresi değişken isimlerinin ilk satırda olduğunu True kullanılan parametreler sırasıyla, hedef niteliği de içeren değeri (yoksa False) atanarak, sep parametresi ise veri herhangi bir etkileşimin söz konusu olmadığı ilişki noktalarını ayıran sembolün “,” olduğunu belirtmektedir. formülünü ifade eden formula, formüldeki değişkenlerin Dec parametresinin kullanımı, sayısal bir nitelik çevrilebilmesi için gerekli olan veri yığınını içeren olmadığından gerekmemektedir. Eğer sayısal bir nitelik değişkeni ifade eden data ve karar ağacının oluşturulma söz konusu olursa, ondalıklı sayının ondalık ayıracını amacını ifade eden method parametreleridir. Bu ifade eden sembol bu parametre ile verilmelidir. fonksiyon ile ilgili yardım için help(rpart) komutundan Kopyala-Yapıştır Komutu ile R’ye Veri Aktarma: yararlanılabilir. Üzerinde çalışılan verinin küçük olması durumunda, veri R ile elde edilen sınıflandırma ağacı modeli biraz daha aktarımı için tercih edilebilecek yöntem kopyala-yapıştır detaylı incelenmek istenirse summary() fonksiyonundan (Control+C/Control+V) yöntemidir. Bu yöntemde, yararlanılır. summary(agac) fonksiyonu yardımıyla öncelikle işlem tablosuna girilmiş olan verinin ihtiyaç detaylı olarak gösterilen sınıflandırma ağacı modeline duyulan kısmının kopyalanması gerekir. Seçme göre, fonksiyonun ürettiği ilk tablo maliyet karmaşıklık işleminden sonra işletim sisteminin uygun kopyalama tuş parametrelerini içerir ve sınıflandırma ağacı için budama düzeni ile kopyalama işlemi gerçekleştirilir. Kopyalama işlemi için gerekli görülüyorsa kullanılır. işleminden sonra R uygulamasına geçiş yapılır. R’de read.table() fonksiyonu bu aşamada faydalı olacaktır. Bu Konu ile ilgili örnek S:149-154’de incelenebilir. fonksiyon için kullanılan parametreler read.csv komutu ile aynıdır. Ancak, kopyala-yapıştır yardımıyla veri aktarılacağı için file parametresi veri yolu yerine “clipboard” ifadesine sahip olacaktır, sep parametresi sekme anlamına gelen “\t” ile kullanılacaktır. Komutun kullanımına dair detaylı bilgiler help(read.table) komutu ile elde edilebilir.