TÜBİTAK 1001 Bilimsel Araştırma Projesi — Kapsamlı Deneysel Performans Raporu
20 Bağımsız Tohum (Seed) × 4 Bootstrap Seviyesi (B) × 36 Veri Kümesi = 2,880 Deney Koşulu × 4 Yöntem = 11,520 Yöntem Değerlendirmesi (Yüz binlerce temel bootstrap modeli ve hiperparametre optimizasyonu)
| B | Yöntem | Ort. RMSE Rank | Ort. Test RMSE | Ort. Test R² | 1.lik Sayısı | Toplam Deney |
|---|
| Yöntem | B=100 | B=250 | B=500 | B=1000 | Δ (100→1000) | Eğilim |
|---|---|---|---|---|---|---|
| Meta LM | 2.05 | 2.08 | 1.78 | 1.77 | -0.28 ↓ | İyileşme (Performans Artışı) |
| Meta T1FF | 2.28 | 2.24 | 2.58 | 2.59 | +0.31 ↑ | Fark* |
| Bagging LM | 2.74 | 2.77 | 2.55 | 2.58 | -0.16 ↓ | İyileşme (Performans Artışı) |
| Bagging T1FF | 2.93 | 2.91 | 3.09 | 3.06 | +0.13 ↑ | Fark* |
* B=500 ve B=1000 değerleri 25 veri seti üzerinden hesaplanmıştır (36 yerine). Veri seti kapsamı farklı olduğu için doğrudan karşılaştırma yaparken dikkatli olunmalıdır.
Her veri kümesinde 20 bağımsız tohum ortalaması üzerinden Test RMSE hata metriğine göre elde edilen ikili üstünlük (Win/Loss) sayılarıdır.
| B | vs Bagging T1FF | vs Bagging LM | vs Meta LM |
|---|---|---|---|
| 100 | 24-12 (66.7%) | 22-14 (61.1%) | 17-19 (47.2%) |
| 250 | 25-11 (69.4%) | 22-14 (61.1%) | 17-19 (47.2%) |
| 500 | 16-9 (64.0%) | 12-13 (48.0%) | 8-17 (32.0%) |
| 1000 | 16-9 (64.0%) | 12-13 (48.0%) | 8-17 (32.0%) |
| B | vs Bagging LM | vs Bagging T1FF | vs Meta T1FF |
|---|---|---|---|
| 100 | 26-9 (72.2%) | 25-11 (69.4%) | 19-17 (52.8%) |
| 250 | 25-10 (69.4%) | 25-11 (69.4%) | 19-17 (52.8%) |
| 500 | 19-5 (76.0%) | 20-5 (80.0%) | 17-8 (68.0%) |
| 1000 | 19-5 (76.0%) | 20-5 (80.0%) | 17-8 (68.0%) |
TÜBİTAK 1001 proje taahhüdü gereği modeller Ortalama Mutlak Yüzde Hata (Test MAPE) metriği üzerinden kıyaslanmıştır.
"Klasik torbalama yönteminin test edilmesi ve Meta Bulanık Torbalama Fonksiyonları yönteminin MAPE ölçütü açısından incelenen veri setlerinin en az %50'sinde daha düşük hata değerleri üretmesi"
Aynı bulanık taban mimarisinde MFF ağırlıklandırmanın klasik torbalamaya etkisi.
| B | Veri Kümesi | Meta T1FF Üstünlük | Oran | ≥ %50? |
|---|---|---|---|---|
| 100 | 36 | 25 | 69.4% | SAĞLANDI |
| 250 | 36 | 24 | 66.7% | SAĞLANDI |
| 500 | 25 | 16 | 64.0% | SAĞLANDI |
| 1000 | 25 | 16 | 64.0% | SAĞLANDI |
Önerilen bulanık modelin parametrik klasik doğrusal torbalamaya karşı başarımı.
| B | Veri Kümesi | Meta T1FF Üstünlük | Oran | ≥ %50? |
|---|---|---|---|---|
| 100 | 36 | 23 | 63.9% | SAĞLANDI |
| 250 | 36 | 22 | 61.1% | SAĞLANDI |
| 500 | 25 | 16 | 64.0% | SAĞLANDI |
| 1000 | 25 | 15 | 60.0% | SAĞLANDI |
Aşırı uç değerlerin bulunduğu ortamlarda gürültü direnci.
| B | vs Bag T1FF | vs Bag LM |
|---|---|---|
| 100 | 14/16 (87.5%) | 13/16 (81.3%) |
| 250 | 13/16 (81.3%) | 12/16 (75.0%) |
| 500 | 10/12 (83.3%) | 10/12 (83.3%) |
| 1000 | 10/12 (83.3%) | 9/12 (75.0%) |
Normal/temiz dağılımlı teorik senaryolar.
| B | vs Bag T1FF | vs Bag LM |
|---|---|---|
| 100 | 8/16 (50.0%) | 9/16 (56.3%) |
| 250 | 8/16 (50.0%) | 9/16 (56.3%) |
| 500 | 5/12 (41.7%) | 6/12 (50.0%) |
| 1000 | 5/12 (41.7%) | 6/12 (50.0%) |
Literatür kıyaslama verileri (Cereal, Cars vb.).
| B | vs Bag T1FF | vs Bag LM |
|---|---|---|
| 100 | 3/4 (75.0%) | 1/4 (25.0%) |
| 250 | 3/4 (75.0%) | 1/4 (25.0%) |
| 500 | 1/1 (100.0%) | 0/1 (0.0%) |
| 1000 | 1/1 (100.0%) | 0/1 (0.0%) |
| B | Yöntem | Min Rank | Max Rank | Ort. Rank | Std. Sapma | Aralık |
|---|
Her tohum ve B kombinasyonunda 4 yöntemin test hatası sıra dereceleri (1.00 = En İyi, 4.00 = En Kötü)
| Tohum (Seed) | Bootstrap (B) | Deney | Bagging T1FF | Meta T1FF (Önerilen) | Bagging LM | Meta LM |
|---|
| Alt Grup | Meta T1FF vs Bag T1FF | Meta T1FF vs Bag LM | Meta LM vs Bag LM | Meta LM vs Bag T1FF |
|---|---|---|---|---|
| Genel (36) | 24-12 (66.7%) | 22-14 (61.1%) | 26-9 (72.2%) | 25-11 (69.4%) |
| Klasik (4) | 2-2 (50.0%) | 2-2 (50.0%) | 2-1 (50.0%) | 3-1 (75.0%) |
| Simülasyon (32) | 22-10 (68.8%) | 20-12 (62.5%) | 24-8 (75.0%) | 22-10 (68.8%) |
| Aykırısız (16) | 9-7 (56.3%) | 10-6 (62.5%) | 9-7 (56.3%) | 7-9 (43.8%) |
| Aykırılı (16) | 13-3 (81.3%) | 10-6 (62.5%) | 15-1 (93.8%) | 15-1 (93.8%) |
Bu 2×2 karşılaştırmalı tasarım çerçevesi, iki temel bilimsel hipotezi incelemek üzere kurgulanmıştır: (1) Taban Model Katkısı: Parametrik doğrusal regresyon (LM) ile kural tabanlı, doğrusal olmayan Tip-1 Bulanık Fonksiyonlar (T1BF / kodda t1ff) arasındaki başarım farkı. (2) Meta-Bulanık Fonksiyon (MFF) Birleştirme Katkısı: Klasik basit aritmetik ortalamaya kıyasla kümeleme ve bulanık üyelik derecelerine dayalı dinamik ağırlıklandırmanın tahmin hatasını azaltma kapasitesi.
| Taban Model Katmanı | Topluluk Birleştirme Mekanizması (Toplama İlkesi) | |
|---|---|---|
| Basit Aritmetik Ortalama (Klasik Torbalama) | Dinamik Bulanık Ağırlıklandırma (MFF Meta-Öğrenme) | |
|
Doğrusal Regresyon (LM) |
1. bagging lm
90/10 Ayrım
Breiman (1996) OLS torbalaması. İlave hiperparametre optimizasyonu gerektirmediğinden, test dışındaki verilerin %90'ı doğrudan eğitim havuzudur. Modeller eşit ağırlıkla toplanır.
|
3. meta lm
80/10/10 Ayrım
%80 Eğitim + %10 Meta + %10 Test. Bootstrap içinde K-Fold pertürbasyonu ile üretilen alt LM modelleri, %10 Meta kümesi üzerinde MFF ile dinamik yerel bulanık ağırlıklandırılır.
|
|
Tip-1 Bulanık Fonksiyon (T1BF) |
2. bagging t1ff
80/10/10 Ayrım
%80 Eğitim + %10 Dondurulmuş Bağımsız Ayar (Tuning) Seti + %10 Test. FCM küme sayısı (c) ve üyelik üssü (f) dış ayar kümesinde seçilir; seçilen B adet model basit aritmetik ortalamayla toplanır.
|
4. meta t1ff Önerilen Model
80/10/10 Ayrım
TÜBİTAK 1001 projesinin önerilen temel yöntemidir. %80 Eğitim + %10 Meta + %10 Test. Taban seviyedeki K-Fold T1BF modelleri, %10 Meta kümesinde MFF ile yerel bulanık ağırlıklandırılır (Çift Kademeli Bulanık Mimari).
|
bagging t1ff, Tip-1 bulanık fonksiyon hiperparametrelerini (c, f) nesnel optimize etmek için %10 bağımsız dondurulmuş ayar kümesi kullansa da, nihai test tahminlerini basit aritmetik ortalama ile topladığı için sol sütundaki klasik torbalama sınıfındadır.En Küçük Kareler (OLS) regresyonunun klasik torbalama (Breiman, 1996) prensipleriyle uygulanmasıdır. Ayarlanacak yapısal hiperparametre bulunmadığından ara validasyon kümesine ihtiyaç duyulmaz; test dışındaki verilerin %90'ı doğrudan eğitim havuzu olarak tahsis edilir.
seed + b) kilitlenmiştir.parallel::parLapply ile dağıtık yürütülür.Tip-1 Bulanık Fonksiyonların (T1BF: Bulanık C-Ortalamalar Kümeleme + Ağırlıklı En Küçük Kareler Regresyonu), %80 eğitim havuzundan çekilen B bootstrap kümesinde eğitilip, dışarıda dondurulmuş %10 bağımsız ayar kümesi üzerinde hiperparametre (c, f) optimizasyonuna tabi tutulmasıdır.
mtcars) 10 bağımsız tohum ve B=1000 ile yapılan testte 80/10/10 tasarımı 90/10 tasarımına karşı 10 tohumun tamamında istatistiksel üstünlük (p = 0.0002) sağlamıştır.Doğrusal regresyon deterministik yapıda olduğundan, bootstrap içinde K-Fold (K=5) çapraz doğrulama ile Jackknife tipi pertürbasyon oluşturularak K adet alt model üretilir. Bu K model, izole %10 Meta veri kümesi üzerinde Meta-Fuzzy Functions (MFF) ile yerel bulanık ağırlıklandırılır.
tune.mff() çalıştırılır.TÜBİTAK 1001 projesi kapsamında geliştirilen temel önerilen yöntemdir. Taban model katmanında doğrusal olmayan Tip-1 Bulanık Fonksiyonlar (T1BF), meta seviyede ise topluluk birleştirici olarak Meta-Fuzzy Functions (MFF) kullanılarak çift kademeli hiyerarşik bulanık mimari oluşturulmuştur.
tune.mff(P_meta, Y_meta) çalıştırılarak K modelin doğrusal olmayan yerel bulanık ağırlık matrisi öğrenilir.bagging t1ff) karşı 36 veri kümesinde %69.44 (B=100) ve %66.67 (B=250) kazanma oranıyla %50 şartı aşılmıştır.
Tüm 36 veri kümesinde SPLIT_SEED = 20260827L parametresi ile %10 test verisi deney öncesinde kilitlenmiştir. 4 yöntemin tamamı, 20 bağımsız tohum ve 4 bootstrap seviyesinde istisnasız birebir aynı test gözlemlerini tahmin etmiştir.
Min-Max normalizasyon istatistikleri (min, max, μ, σ) test verisine kesinlikle sızdırılmamıştır. bagging lm %90 havuz parametreleriyle, diğer 3 yöntem ise %80 havuz parametreleriyle dönüştürülmüştür.
Parametre optimizasyonu gerektirmeyen bagging lm veriyi eksiksiz değerlendirmek için %90'ı doğrudan eğitime vermiştir. Parametre optimize eden bagging t1ff %10'u ayar kümesine, meta yöntemler ise MFF kümeleme ağırlıklarına ayırmıştır.
İşlemcideki 8 çekirdekten 7'si parallel::makeCluster(7) ile izole R iş parçacıkları olarak yapılandırılmıştır (1 çekirdek işletim sistemi kararlılığı için ayrılmıştır).
clusterEvalQ(cl, gc())) hem ana R oturumunda bellek temizliği yapılarak RAM sızıntısı engellenmiştir.seed + b * 10000L tohumlarıyla kilitlenerek %100 tekrarlanabilirlik sağlanmıştır.Kapsamlı simülasyon sürecinde veri kaybını önlemek ve çalışma güvenilirliğini sağlamak amacıyla:
(Veri_Seti, Seed, B) deneyi tamamlandığı anda write.table(..., append = TRUE) ile doğrudan diske kaydedilmiştir.1. MFF Bulanık Ağırlıklandırmanın Tutarlı Üstünlüğü
İncelenen tüm B değerlerinde MFF ile dinamik ağırlıklandırılan meta modeller, klasik aritmetik ortalamalı torbalama modellerine kıyasla daha düşük hata ve daha iyi sıra derecesi (rank) üretmiştir.
2. Bootstrap Sayısının Meta Modellerin Ayrışmasına Etkisi
B sayısı 100'den 1000'e yükseldikçe meta lm modelinin ortalama rankı 2.05'ten 1.77'ye gerilemiş, birincilik oranı %54.6'ya ulaşmıştır. Yüksek B seviyesi, MFF'nin birleştirebileceği tahmin çeşitliliğini zenginleştirmektedir.
3. Aykırı Değer İçeren Senaryolarda Dayanıklılık
Aykırı değerli simülasyon senaryolarında meta lm klasik Bagging LM'e karşı %93.8 oranında üstünlük sağlamıştır. meta t1ff ise klasik Bagging T1FF'e karşı %87.5 (B=100) ve %81.3 (B=250) oranında daha düşük hata üretmiştir.
4. 20 Bağımsız Tohum Üzerinde İstatistiksel Kararlılık
20 farklı rastgele tohum üzerinde yapılan varyans analizinde model rank standart sapması σ ≈ 0.067 olarak hesaplanmıştır. Meta modeller ile klasik modellerin sıralama aralıkları ayrışmış ve kararlılık doğrulanmıştır.
Bu teknik rapor, TÜBİTAK 1001 Bilimsel Araştırma Projesi kapsamında geliştirilen V2 2×2 Karşılaştırmalı Kıyaslama Boru Hattı'nın algoritmik detaylarını, uçtan uca veri akışını, matematiksel formülasyonlarını, paralel çekirdek optimizasyonunu ve disk kontrol noktası (streaming checkpoint) mimarisini belgelemek amacıyla hazırlanmıştır.
| Bileşen / Dosya | Satır Sayısı | Sorumluluk Rolü | Teknik Açıklama |
|---|---|---|---|
| yeni4_yontem_v2.R | ~340 | Yöntem Fonksiyonları | bagging lm, bagging t1ff, meta lm ve meta t1ff modellerinin paralel çekirdek destekli çekirdek fonksiyonları. |
| yeni_kiyas_v2.R | ~560 | Çalıştırıcı & Boru Hattı | 36 veri kümesi, 7-çekirdek kümesi (parallel), 90/10 vs 80/10/10 veri izolasyonu ve canlı diske yazım döngüsü. |
| winlose_yeni4_v2.R | ~330 | Analiz & Raporlama | 5 alt grupta ikili galibiyet (win/loss) oranları, Friedman rank hesaplamaları ve birleşik tohum özet tabloları. |
| YENI4_SONUCLAR_V2/ | — | Kalıcı Veri Deposu | 11,520 yöntem değerlendirmesinin ham ve özet CSV kütüklerinin izole olarak arşivlendiği sonuç dizini. |
| Taban Model Katmanı | Topluluk Birleştirme Mekanizması (Toplama İlkesi) | |
|---|---|---|
| Basit Aritmetik Ortalama (Klasik Torbalama) | Dinamik Bulanık Ağırlıklandırma (MFF Meta-Öğrenme) | |
|
Doğrusal Regresyon (LM) |
1. bagging lm
90/10 Ayrım
Breiman (1996) OLS torbalaması. İlave hiperparametre gerektirmediğinden %90 verinin tamamı doğrudan eğitim havuzudur. Modeller eşit ağırlıkla toplanır.
|
3. meta lm
80/10/10 Ayrım
%80 Eğitim + %10 Meta + %10 Test. K-Fold alt LM modelleri Meta kümesinde MFF ile yerel bulanık ağırlıklandırılır.
|
|
Tip-1 Bulanık Fonksiyon (T1BF) |
2. bagging t1ff
80/10/10 Ayrım
%80 Eğitim + %10 Bağımsız Dondurulmuş Tuning Seti + %10 Test. FCM parametreleri dış ayar kümesinde seçilir; seçilen B model basit aritmetik ortalamayla toplanır.
|
4. meta t1ff Önerilen Model
80/10/10 Ayrım
%80 Eğitim + %10 Meta + %10 Test. Çift kademeli hiyerarşik bulanık mimari (K-Fold T1BF tabanı + MFF meta ağırlıklandırması).
|
bagging t1ff, Tip-1 bulanık fonksiyon hiperparametrelerini (c, f) dış ayar kümesinde optimize etse de, nihai test tahminlerini basit aritmetik ortalama ile birleştirdiği için klasik torbalama sınıfındadır.Parametrik doğrusal regresyon (LM) ile kural tabanlı, doğrusal olmayan Tip-1 Bulanık Fonksiyonlar (T1BF) arasındaki başarım farkı nedir?
Klasik basit ortalamaya kıyasla FCM kümeleme ve bulanık üyelik derecelerine dayalı MFF dinamik ağırlıklandırması tahmin hatasını ne ölçüde azaltmaktadır?
Deney boru hattı 4 klasik veri setinin ardından 32 simülasyon Excel senaryosunu deterministik sırayla yürütür:
Normal dağılımlı, gürültüsüz 16 senaryo:
Aşırı uç değer içeren 16 gürültülü senaryo:
Hiperparametre optimizasyonu gerektirmez; test dışındaki tüm verilerin %90'ı doğrudan eğitim kümesidir.
β̂b = (XbT Xb)-1 XbT Yb.Ŷtest, b = Xtest β̂b.Ŷ = (1/B) · ∑ Ŷtest, b.seed + b tohumuyla kilitlidir.Tip-1 Bulanık Fonksiyonlar %80 eğitimden çekilen B bootstrap kümesinde eğitilir ve dışarıda dondurulmuş %10 bağımsız tuning seti üzerinde hiperparametre (c, f) optimizasyonu yapılır.
Ŷ = (1/B) · ∑ Ptest[, b].mtcars üzerinde 10 tohum × B=1000 deneyinde 80/10/10 mimarisi 90/10 mimarisine karşı 10-0 kazanmıştır (p = 0.0002).Doğrusal modeller deterministik olduğundan, bootstrap içinde K-Fold (K=5) pertürbasyonu uygulanarak K alt model üretilir ve izole %10 Meta seti üzerinde MFF ile yerel konveks ağırlıklandırılır.
tune.mff(P_meta, Y_meta) ile hata alanları kümelenir ve her test noktası için dinamik ağırlıklar wk(x) hesaplanır.ŷmeta_lm, b(x) = ∑ wk(x) · ŷk(x), ∑ wk(x) = 1.TÜBİTAK 1001 projesinin temel önerilen yöntemidir. Taban model katmanında T1BF, meta birleştiricide MFF kullanılarak çift kademeli hiyerarşik bulanık mimari oluşturulmuştur.
tune.mff() çalıştırılarak doğrusal olmayan yerel bulanık ağırlık matrisi öğrenilir.Ŷ = (1/B) · ∑ ŷmeta_t1ff, b.bagging t1ff'e karşı %64.0 – %69.4 kazanma oranıyla %50 taahhüdünü fazlasıyla aşmıştır.bagging lm'e karşı %60.0 – %63.9 kazanma oranı elde etmiştir.
İşlemcideki 8 çekirdekten 7'si parallel::makeCluster(7) ile izole R düğümleri olarak yapılandırılmıştır (1 çekirdek işletim sistemi kararlılığı için ayrılmıştır).
clusterEvalQ(cl, gc())) hem ana R oturumunda bellek temizliği yapılarak RAM sızıntısı engellenmiştir.seed + b * 10000L tohumlarıyla kilitlenerek %100 tekrarlanabilirlik sağlanmıştır.Kapsamlı simülasyon sürecinde elektrik kesintisi, donanım kapanması veya kesinti durumlarında sıfır veri kaybı sağlamak amacıyla:
(Veri_Seti, Seed, B) deneyi bittiği saniyede write.table(..., append = TRUE) ile doğrudan diske kaydedilmiştir.winlose_yeni4_v2.R çalıştırılarak ara sonuçlar anlık olarak analiz edilebilmektedir.YENI4_SONUCLAR_V2/ klasörüne otomatik üretilen kütükler:
Yeni4_v2_Canli_Ham_Sonuclar.csv: 11,520 satırlık ana ham kütük (Checkpoint kaynağı).Yeni4_v2_Seed_B_Ozet_Rank_Tablosu.csv: Seed, B bazında 4 modelin genel ortalama rank matrisi.Yeni4_v2_Seed_B_VeriSeti_Rank_Tablosu.csv: Veri seti bazında modellerin sıralama detay tablosu.Yeni4_v2_VeriSeti_Ozet_*.csv: Her veri kümesi ve B için Ortalama ± Standart Sapma metrikleri.Deneyleri RStudio konsolundan doğrudan çalıştırmak için:
# 1. Kıyaslama Boru Hattını Başlatma:
source("yeni_kiyas_v2.R")
# 2. Ara/Nihai Win/Loss Raporunu Üretme:
source("winlose_yeni4_v2.R")
# 3. Veri Seti Kapsamı (Satır 103):
VERI_SETI_MODU <- "hepsi" # "klasik", "simulasyon", "hepsi"
Meta Bulanık Torbalama Fonksiyonları — TÜBİTAK 1001 Projesi • 2026