4 dk okuma
Giriş
Regression modeller, bir girdiden sürekli sayısal bir değer tahmin etmek için kullanılan makine öğrenmesi yöntemleridir. Ev fiyatı, satış miktarı, teslim süresi veya finansal getirinin beklenen büyüklüğü gibi çıktılar regression problemine örnektir. ML.NET tarafında farklı veri yapıları için SDCA, FastTree, FastForest ve LightGBM gibi trainer’lar kullanılabilir. Fakat en iyi model diye tek bir seçenek yoktur; doğru model veri setinin yapısına ve hedef metriğe bağlıdır.
Linear regression ne zaman yeterlidir?
Hedef ile feature’lar arasındaki ilişkinin büyük ölçüde doğrusal olduğu durumlarda lineer modeller güçlü bir baseline sunar. SDCA gibi yöntemler hızlı eğitilir, yorumlanması kolaydır ve büyük sparse feature setlerinde iyi sonuç verebilir. Ayrıca basit modelin performansı karmaşık modeller için kıyas noktası oluşturur. Eğer tree tabanlı model baseline’ı anlamlı biçimde geçemiyorsa karmaşıklığın faydası sorgulanmalıdır.
FastTree ve FastForest arasındaki fark
FastTree gradient boosting yaklaşımını kullanır; her yeni ağaç önceki ağaçların hatalarını azaltmaya çalışır. FastForest ise random forest mantığına daha yakındır ve çok sayıda ağacın sonucunu birleştirir. Boosting çoğu yapılandırılmış veri setinde güçlü doğruluk sağlayabilirken forest yaklaşımı gürültüye karşı daha dengeli olabilir. Hangi modelin daha iyi olduğu ancak aynı validation seti üzerinde ölçülerek anlaşılır.
LightGBM neden sık tercih edilir?
LightGBM, tabular veride yüksek performans ve hızlı eğitim dengesi nedeniyle sık kullanılan gradient boosting algoritmalarından biridir. Çok sayıda feature, doğrusal olmayan ilişkiler ve etkileşimler bulunduğunda güçlü sonuçlar verebilir. Buna rağmen küçük veya gürültülü veri setlerinde aşırı öğrenme riski vardır. Hyperparameter araması yapılırken yalnızca training skoruna değil validation metriklerine bakmak gerekir.
Finansal veride regression kullanırken dikkat
Finansal zaman serileri durağan değildir; piyasa rejimi, volatilite ve likidite zaman içinde değişir. Bu nedenle ‘bir sonraki mum yüzde kaç yükselir?’ gibi hedefler üzerinde elde edilen iyi backtest skoru gelecekte aynı performansı garanti etmez. Feature leakage, yanlış chronological split ve maliyetleri yok saymak regression modelini olduğundan iyi gösterebilir.
RSquared, MAE ve RMSE birlikte okunmalı
RSquared modelin varyansın ne kadarını açıkladığını gösterir ancak tek başına yeterli değildir. MAE ortalama mutlak hatayı daha sezgisel sunar. RMSE büyük hataları daha fazla cezalandırır. Finansal tahminlerde ayrıca modelin yön doğruluğu, belirli eşik üzerindeki precision değeri veya stratejiye dönüştürüldüğünde oluşan risk/ödül dağılımı da incelenmelidir.
Model seçimi için pratik yaklaşım
Önce naive veya lineer bir baseline kurun. Ardından aynı feature seti ile FastTree, FastForest ve LightGBM gibi modelleri aynı zaman bölünmesinde karşılaştırın. Eğitim süresi, prediction latency ve model boyutunu da metriklere ekleyin. En yüksek RSquared değerini değil, farklı dönemlerde tutarlı performans veren modeli tercih etmek production için daha güvenlidir.
Sonuç
Regression modeller sayısal tahmin problemlerinde güçlü araçlardır. ML.NET içinde lineer ve tree tabanlı birçok seçenek bulunur. Sağlıklı model seçimi ise algoritma isminden çok doğru validation, uygun metrikler ve problemin doğasını anlamaya bağlıdır.
Araştırma Kaynakları ve İleri Okuma
- NET metrics – https://learn.microsoft.com/en-us/dotnet/machine-learning/resources/metrics
- Train and evaluate a model – https://learn.microsoft.com/en-us/dotnet/machine-learning/how-to-guides/train-machine-learning-model-ml-net
- NET tasks – https://learn.microsoft.com/en-us/dotnet/machine-learning/resources/tasks

