Integrating Financial Stress and Market Volatility into the Detection of Greenwashing Using Machine Learning: Evidence from S&P 500 Companies

Makine Öğrenmesi Tabanlı Yeşil Aklama Tespitinde Finansal Stres ve Piyasa Oynaklığının Entegrasyonu: S&P 500 Şirketlerinden Bulgular
Author:

Rüya KAPLAN YILDIRIM-

Number of pages:
1565-1629
Language:
İngilizce
Year-Number:
2026-Volume 21 Issue Ö1
%>

Abstract

Sürdürülebilirlik raporlamasının kurumsal iletişimde giderek merkezi bir konuma gelmesiyle birlikte, şirketlerin beyan ettikleri çevresel taahhütler ile fiili uygulamaları arasındaki tutarsızlık, yatırımcılar ve düzenleyici kurumlar açısından önemli bir güvenilirlik sorunu haline gelmiştir. Bu çalışmanın amacı, S&P 500 endeksinde yer alan şirketlerin çevresel taahhütlerinin güvenilirliğini değerlendirmek ve bu bağlamda makine öğrenmesi tabanlı bir yeşil aklama (greenwashing) tespit modeli geliştirmektir. Konuyla ilgili mevcut literatür incelendiğinde, çalışmaların büyük çoğunluğunun yalnızca metinsel özelliklere odaklandığı ve finansal ile piyasa temelli göstergeleri büyük ölçüde göz ardı ettiği görülmektedir. Bu çalışma ise söz konusu boşluktan hareketle, metinsel özellikler ile finansal baskı unsurlarının ve piyasa oynaklığının tek bir modelde bütünleştirilmesinin sınıflandırma performansını artırıp artırmadığını sistematik biçimde incelemektedir. Bu doğrultuda, 503 şirkete ait veriler kullanılarak doğal dil işleme teknikleri (ClimateBERT, TF-IDF, duygu analizi, okunabilirlik ölçütleri ve belirsizlik ifadeleri), finansal yapı göstergeleri (kaldıraç oranı, aktif kârlılığı, firma büyüklüğü, sektörel duyarlılık) ve GARCH (1,1) modeline dayalı piyasa oynaklığı göstergeleri olmak üzere toplam 21 özellik oluşturulmuş ve bu özellikler XGBoost sınıflandırıcısına girdi olarak sunulmuştur. Bağımlı değişken, ISS yönetişim risk skorunun dinamik eşikleme yöntemiyle ikili bir sınıfa dönüştürülmesiyle elde edilmiştir. Elde edilen bulgulara göre model, 0,704 ROC-AUC değeri ve 0,756 Spearman sıra korelasyon katsayısı ile tatmin edici bir sınıflandırma performansı sergilemiştir. SHAP analizi sonuçları, en yüksek açıklayıcılığa sahip sinyallerin piyasa oynaklığı göstergeleri olduğunu, ancak metinsel özelliklerin de model performansına önemli katkı sağladığını ortaya koymuştur. Bulgularımız ayrıca, metinsel özelliklerin karar aşamasında modelin duyarlılığını artırarak tamamlayıcı bir işlev üstlendiğine işaret etmektedir. Bu bağlamda çalışma, yeşil aklama tespitinde tek bir veri kaynağına dayanmak yerine, kurumsal söylemi, finansal yapıyı ve piyasa tepkisini eş zamanlı olarak değerlendiren çok kanallı model mimarilerinin daha güvenilir ve tutarlı sonuçlar ürettiğini göstermekte, gelecekteki çalışmalar için de bu tür bütünleşik yaklaşımların benimsenmesini önermektedir.

Keywords

Abstract

As sustainability reporting has taken on an increasingly central role in corporate communications, the inconsistency between companies’ stated environmental commitments and their actual practices has become a significant credibility issue for investors and regulatory bodies. The aim of this study is to assess the reliability of the environmental commitments made by companies in the S&P 500 index and, in this context, to develop a machine learning-based model for detecting greenwashing. A review of the existing literature on this topic reveals that the vast majority of studies focus solely on textual features and largely disregard financial and market-based indicators. Building on this gap, this study systematically examines whether integrating textual features with financial stress factors and market volatility into a single model improves classification performance. Accordingly, using data from 503 companies, natural language processing techniques (ClimateBERT, TF-IDF, sentiment analysis, readability metrics, and expressions of uncertainty), financial structure indicators (leverage ratio, return on assets, firm size, sector sensitivity), and market volatility indicators based on the GARCH(1,1) model—totaling 21 features—were created and fed as inputs to the XGBoost classifier. The dependent variable was obtained by converting the ISS governance risk score into a binary class using a dynamic thresholding method. According to the findings, the model demonstrated satisfactory classification performance with an ROC-AUC value of 0.704 and a Spearman rank correlation coefficient of 0.756. The results of the SHAP analysis revealed that the signals with the highest explanatory power were market volatility indicators, although textual features also made a significant contribution to model performance. Our findings also indicate that textual features play a complementary role by increasing the model’s sensitivity during the decision-making process. In this context, the study demonstrates that, rather than relying on a single data source for greenwashing detection, multi-channel model architectures that simultaneously evaluate corporate discourse, financial structure, and market reaction produce more reliable and consistent results, and recommends the adoption of such integrated approaches for future research.

Keywords

Greenwashing, ESG, Financial Pressure, Machine Learning, Financial Structure Indicators

Structured Abstract:

Most of the existing greenwashing detection literature relies almost exclusively on textual disclosure features, leaving the potential contribution of firm-level financial pressure and market-based signals largely unexamined. This study aims to build a machine-learning-based greenwashing detection model that evaluates the credibility of the environmental commitments made by S&P 500 companies by combining textual, financial, and market-volatility information. Specifically, we investigate whether incorporating GARCH-based conditional stock-return volatility as a proxy for investor skepticism toward corporate environmental claims, alongside natural language processing (NLP) and financial structure indicators, improves classification performance compared to text-only approaches. This multi-channel approach addresses a glaring gap in the literature: no previous study has combined time-series market-volatility dynamics with textual and financial indicators within a single ESG-credibility classifier, and so it is important to test whether “market skepticism” reflected in volatility has any additional and independent explanatory power beyond disclosure language and balance-sheet pressure.

The study is based on a quantitative and predictive machine-learning model on a sample of 503 S&P 500 companies, which are classified by GICS sector. We constructed three independent data channels. The NLP channel uses six features from company disclosure text such as TF-IDF (the weights of nine ESG-specific terms, a Loughran-McDonald ESG-extended sentiment score, Flesch and Gunning Fog readability indices, hedge word count and a ClimateBERT (DistilRoBERTa)-based greenwashing score with temperature scaling. Five features are incorporated in the financial channel (firm size, return on assets, leverage ratio and GICS sector sensitivity). The market channel uses ten cross-sectional features (company-specific GARCH (1,1) based on daily stock returns) based on the data from a firm, though we make use of a prediction before the forecast window as they are more likely to be leaked. The 21 resulting features were aggregated into a single matrix and fed into an XGBoost classifier, with hyperparameters tuned by RandomizedSearchCV and class imbalance dealt with through a dynamically adjusted scale_pos_weight. The binary dependent variable was built by applying a dynamic percentile threshold to the ISS Governance QualityScore. The dataset was split 80/20 (402 training, 101 test companies) using stratified sampling and SHAP (TreeExplainer) was used for explainability. Three robustness tests were designed: ablation test, where all GARCH features were removed, isolation test using only GARCH features, and lagged-GARCH test, where volatility parameters are re-estimated only on the first 70% of return history as an anti-data leakage check.

On the held-out test set of 101 previously unknown firms, the full model has an ROC-AUC of 0.704 and Spearman rank correlation of 0.756 which is an informative classification and a strong risk ranking consistency for a model built on a very small number of explanatory variables. SHAP analysis showed that market-volatility features are the focus of the explanation of the model outputs. Three of the top five and eight of the top thirteen predictors are from the GARCH channel, with garch_vol_last (SHAP = 0.668) being the strongest predictor before leverage and Gunning Fog readability. However, we found that volatility alone is not enough. When the GARCH features are used in isolation, the ROC-AUC is only slightly less (0.638, -2.3%), and Average Precision is only 20.7% worse (0.467), showing that the volatility is the most predictive feature in this case, even if there is no textual or financial context. When the GARCH features are removed completely, the ROC-AUC is still only 0.012 (1.8%) and the accuracy is 7.5%, indicating that NLP and financial features are very discriminating on their own and leverage (0.662) and Gunning Fog (0.618) are the most predictive features. The lagged-GARCH robustness test using volatility parameters estimated from only the first 70% of the return history outperformed the contemporary baseline model (ROC-AUC 0.704 vs. 0.653; Spearman ρ 0.756 vs. 0.739). This indicates that if the look-ahead data leaks, the market-volatility signal is not temporary but rather is a structural relationship.

The results suggest that greenwashing risk cannot be captured in only one information source: market volatility signals are the major drivers of the ranking performance but textual and financial features are also needed to enhance the decision-level precision and reduce the number of false positives. If we use multi-channel models which assess the corporate discourse, financial structure and market response jointly, we will find that greenwashing classification is more reliable than the single channel model. The study contributes to the literature in two ways. One is that the authors, for the first time, have introduced firm-level GARCH-derived volatility dynamics into an ESG-credibility classifier, which is key to the theory that heterogeneous investor beliefs about ESG authenticity are reflected in the variance in conditional returns. Second, the model's stability in ranking is also useful for portfolio ESG screening. The authors have performed three rigorous robustness tests and demonstrated that volatility influences a good AUC while textual complexity and hedging language affects the classification accuracy. The study is predictive rather than causal and it relies on a single governance risk provider (ISS) and proxy disclosure reports instead of complete CSR/CDP/TCFD reports; this is a cross-sectional, single-period (2023-2024) study focused on S&P 500 firms and future studies using greenwashing cases, alternative ESG rating providers, panel data and instrumental-variable or Granger-causality designs should be undertaken to establish causality and generalizability.

 

Keywords : Greenwashing, ESG, Financial Pressure, Machine Learning, Financial Structure Indicators.

Yapılandırılmış Özet:

Yeşil aklama tespitine ilişkin literatürün büyük bir kısmı neredeyse tamamen metinsel açıklama özelliklerine dayanmakta olup, şirket düzeyindeki finansal baskı ve piyasa temelli sinyallerin potansiyel katkısı büyük ölçüde incelenmemiştir. Bu çalışma, metinsel, finansal ve piyasa oynaklığı bilgilerini birleştirerek S&P 500 şirketleri tarafından verilen çevresel taahhütlerin güvenilirliğini değerlendiren, makine öğrenimi tabanlı bir yeşil yıkama tespit modeli oluşturmayı amaçlamaktadır. Özellikle, doğal dil işleme (NLP) ve finansal yapı göstergelerinin yanı sıra, şirketlerin çevresel iddialarına yönelik yatırımcı şüpheciliğinin bir göstergesi olarak GARCH tabanlı koşullu hisse senedi getiri oynaklığının dahil edilmesinin, yalnızca metne dayalı yaklaşımlara kıyasla sınıflandırma performansını iyileştirip iyileştirmediğini araştırıyoruz. Bu çok kanallı yaklaşım, literatürdeki bariz bir boşluğu doldurmaktadır: Daha önce hiçbir çalışma, zaman serisi piyasa oynaklığı dinamiklerini metinsel ve finansal göstergelerle tek bir ESG güvenilirlik sınıflandırıcısı içinde birleştirmedi; bu nedenle, oynaklıkta yansıyan “piyasa şüpheciliğinin”, açıklama dilinin ve bilanço baskısının ötesinde ek ve bağımsız bir açıklayıcı güce sahip olup olmadığını test etmek önemlidir.

Bu çalışma, GICS sektörlerine göre sınıflandırılmış 503 S&P 500 şirketinden oluşan bir örneklem üzerinde geliştirilen nicel ve öngörücü bir makine öğrenimi modeline dayanmaktadır. Üç bağımsız veri kanalı oluşturulmuştur. NLP kanalı, şirket açıklama metinlerinden TF-IDF (dokuz ESG'ye özgü terimin ağırlıkları, Loughran-McDonald ESG genişletilmiş duyarlılık puanı, Flesch ve Gunning Fog okunabilirlik endeksleri, hedge kelime sayısı ve sıcaklık ölçeklendirmesine sahip ClimateBERT (DistilRoBERTa) tabanlı greenwashing puanı) gibi altı özelliği kullanmaktadır. Finansal kanalda beş özellik yer almaktadır (şirket büyüklüğü, aktif kârlılığı, kaldıraç oranı ve GICS sektör duyarlılığı). Piyasa kanalı, bir şirketten elde edilen verilere dayalı on kesitsel özellik (günlük hisse senedi getirilerine dayalı şirkete özgü GARCH (1,1) kullanmaktadır; ancak bu verilerin sızma olasılığı daha yüksek olması nedeni ile tahmin penceresinden önceki bir tahmin kullanılmıştır. Elde edilen 21 özellik tek bir matris halinde birleştirilerek bir XGBoost sınıflandırıcısına beslenmiştir; hiperparametreler RandomizedSearchCV ile ayarlanmış ve sınıf dengesizliği dinamik olarak ayarlanan scale_pos_weight ile giderilmiştir. İkili bağımlı değişken, ISS Governance QualityScore’a dinamik bir persentil eşiği uygulanarak oluşturulmuştur. Veri kümesi, tabakalı örnekleme yöntemi kullanılarak 80/20 oranında (402 eğitim, 101 test şirketi) bölündü ve açıklanabilirlik için SHAP (TreeExplainer) kullanılmıştır. Üç adet sağlamlık testi tasarlanmıştır: tüm GARCH özelliklerinin kaldırıldığı ablasyon testi, yalnızca GARCH özelliklerinin kullanıldığı izolasyon testi ve veri sızıntısını önlemek amacıyla volatilite parametrelerinin getiri geçmişinin yalnızca ilk %70’i üzerinde yeniden tahmin edildiği gecikmeli GARCH testi.

Daha önce bilinmeyen 101 firmadan oluşan ayrılmış test kümesinde, tam model 0,704 ROC-AUC ve 0,756 Spearman sıra korelasyonu değerlerine sahiptir; bu, çok az sayıda açıklayıcı değişken üzerine inşa edilmiş bir model için bilgilendirici bir sınıflandırma ve güçlü bir risk sıralama tutarlılığı anlamına gelir. SHAP analizi, piyasa volatilitesi özelliklerinin model çıktılarının açıklanmasında odak noktası olduğunu göstermiştir. İlk beş tahmin değişkeninden üçü ve ilk on üç tahmin değişkeninden sekizi GARCH kanalından gelmektedir; garch_vol_last (SHAP = 0,668), kaldıraç ve Gunning Fog okunabilirliğinden önce en güçlü tahmin değişkenidir. Ancak, oynaklığın tek başına yeterli olmadığını tespit ettik. GARCH özellikleri tek başına kullanıldığında, ROC-AUC değeri sadece biraz daha düşük (0,638, -%2,3) ve Ortalama Hassasiyet sadece %20,7 daha kötü (0,467) çıkmıştır; bu da, metinsel veya finansal bağlam olmasa bile, bu durumda oynaklığın en iyi tahmin eden özellik olduğunu göstermektedir. GARCH özellikleri tamamen kaldırıldığında, ROC-AUC değeri yine de sadece 0,012 (%1,8) ve doğruluk oranı %7,5’tir; bu da NLP ve finansal özelliklerin tek başlarına oldukça ayırt edici olduğunu ve kaldıraç (0,662) ile Gunning Fog (0,618) değerlerinin en iyi tahmin eden özellikler olduğunu göstermektedir. Getiri geçmişinin yalnızca ilk %70’inden tahmin edilen oynaklık parametrelerini kullanan gecikmeli GARCH sağlamlık testi, çağdaş referans modelden daha iyi performans gösterdi (ROC-AUC 0,704’e karşı 0,653; Spearman ρ 0,756’ya karşı 0,739). Bu durum, ileriye dönük verilerin sızması halinde piyasa volatilitesi sinyalinin geçici değil, yapısal bir ilişki olduğunu göstermektedir.

Sonuçlar, yeşil aklama riskinin tek bir bilgi kaynağıyla tespit edilemeyeceğini göstermektedir: Piyasa oynaklığı sinyalleri, sıralama performansının başlıca belirleyicileridir; ancak karar düzeyindeki doğruluğu artırmak ve yanlış pozitif sonuçların sayısını azaltmak için metinsel ve finansal özelliklerin de dikkate alınması gerekmektedir. Kurumsal söylemi, finansal yapıyı ve piyasa tepkisini bir arada değerlendiren çok kanallı modeller kullanırsak, yeşil yıkama sınıflandırmasının tek kanallı modele kıyasla daha güvenilir olduğunu göreceğiz. Bu çalışma, literatüre iki yönden katkı sağlamaktadır. Birincisi, yazarların ilk kez şirket düzeyinde GARCH modelinden türetilen oynaklık dinamiklerini bir ESG güvenilirlik sınıflandırıcısına dahil etmeleridir; bu, ESG'nin gerçekliği hakkındaki heterojen yatırımcı inançlarının koşullu getirilerdeki varyansa yansıdığı teorisi açısından kilit öneme sahiptir. İkincisi, modelin sıralamadaki istikrarı, portföy ESG taraması için de yararlıdır. Yazarlar, üç titiz sağlamlık testi gerçekleştirmiş ve volatilitenin iyi bir AUC değerine katkıda bulunduğunu, metinsel karmaşıklık ile riskten korunma dilinin ise sınıflandırma doğruluğunu etkilediğini göstermiştir. Bu çalışma nedensel olmaktan ziyade öngörücü nitelikte olup, eksiksiz CSR/CDP/TCFD raporları yerine tek bir yönetişim riski sağlayıcısına (ISS) ve vekaleten sunulan açıklama raporlarına dayanmaktadır. Çalışma, S&P 500 şirketlerine odaklanan kesitsel, tek dönemli (2023-2024) bir çalışmadır; nedensellik ve genelleştirilebilirliği tespit etmek için gelecekte yeşil aklama vakalarını, alternatif ESG derecelendirme sağlayıcılarını, panel verilerini ve araç değişken veya Granger nedensellik tasarımlarını kullanan çalışmalar yürütülmelidir.

 

Anahtar Kelimeler: Yeşil Aklama, ESG, Finansal Baskı, Makine Öğrenmesi, Finansal Yapı Göstergeleri

الملخص المنظَّم

تعتمد معظم الأدبيات القائمة بشأن الكشف عن الغسل الأخضر اعتمادًا شبه حصري على خصائص الإفصاحات النصية، في حين تظل الإسهامات المحتملة للضغوط المالية على مستوى الشركات والإشارات المستمدة من السوق غير مدروسة إلى حدٍّ كبير. وتهدف هذه الدراسة إلى بناء نموذج قائم على تعلُّم الآلة للكشف عن الغسل الأخضر، يُقيِّم مصداقية الالتزامات البيئية التي تعلنها الشركات المدرجة في مؤشر S&P 500، من خلال دمج المعلومات النصية والمالية ومعلومات تقلبات السوق. وعلى وجه التحديد، تبحث الدراسة فيما إذا كان إدراج التقلب الشرطي لعوائد الأسهم، المقدَّر باستخدام نماذج الانحدار الذاتي المعمَّم للتباين الشرطي غير المتجانس (GARCH)، بوصفه مؤشرًا بديلًا لتشكُّك المستثمرين في الادعاءات البيئية للشركات، إلى جانب مؤشرات معالجة اللغة الطبيعية (NLP) والهيكل المالي، يُحسِّن أداء التصنيف مقارنةً بالمقاربات المعتمدة على النصوص وحدها. وتعالج هذه المقاربة متعددة القنوات فجوةً واضحةً في الأدبيات؛ إذ لم تجمع أي دراسة سابقة بين ديناميات تقلبات السوق في السلاسل الزمنية والمؤشرات النصية والمالية ضمن مُصنِّف واحد لمصداقية الممارسات البيئية والاجتماعية والحوكمة (ESG). ومن ثمَّ، تبرز أهمية اختبار ما إذا كان «تشكُّك السوق»، المنعكس في التقلبات، يمتلك قدرةً تفسيريةً إضافيةً ومستقلةً تتجاوز لغة الإفصاح والضغوط المرتبطة بالميزانية العمومية.

تستند الدراسة إلى نموذج كمي تنبؤي قائم على تعلُّم الآلة، طُبِّق على عينة من 503 شركات مدرجة في مؤشر S&P 500، ومصنَّفة قطاعيًا وفقًا للمعيار العالمي لتصنيف القطاعات (GICS). وقد جرى إنشاء ثلاث قنوات مستقلة للبيانات. تستخدم قناة معالجة اللغة الطبيعية ست سمات مستخرجة من نصوص إفصاحات الشركات، تشمل أوزان تسعة مصطلحات خاصة بالجوانب البيئية والاجتماعية والحوكمة، محسوبةً وفق مقياس تكرار المصطلح–معكوس تكرار الوثيقة (TF-IDF)، ودرجةً للمشاعر مستندةً إلى معجم لوغران–ماكدونالد الموسَّع ليشمل مصطلحات ESG، ومؤشري فليش وغانينغ فوغ لقابلية القراءة، وعدد ألفاظ التحوُّط اللغوي، ودرجةً للغسل الأخضر مستندةً إلى نموذج ClimateBERT ‏(DistilRoBERTa)، مع تطبيق معايرة درجة الحرارة. وتضم القناة المالية خمس سمات، هي حجم الشركة، والعائد على الأصول، ونسبة الرافعة المالية، وحساسية القطاع وفق تصنيف GICS. أما قناة السوق فتستخدم عشر سمات مقطعية مستمدة من بيانات كل شركة، بالاستناد إلى نموذج GARCH (1,1) خاص بالشركة ومقدَّر باستخدام عوائد الأسهم اليومية؛ ومع ذلك، نستخدم تنبؤًا سابقًا لنافذة التنبؤ، نظرًا إلى ارتفاع احتمال تسرُّب البيانات المرتبطة بها. وجُمعت السمات الإحدى والعشرون الناتجة في مصفوفة واحدة، وأُدخلت إلى مُصنِّف XGBoost، مع ضبط المعلمات الفائقة باستخدام RandomizedSearchCV، ومعالجة عدم توازن الفئات من خلال التعديل الديناميكي للمعلمة scale_pos_weight. وبُني المتغير التابع الثنائي بتطبيق عتبة مئينية ديناميكية على مؤشر جودة الحوكمة الصادر عن ISS ‏(ISS Governance QualityScore). وقُسِّمت مجموعة البيانات بنسبة 80/20، بواقع 402 شركة للتدريب و101 شركة للاختبار، باستخدام المعاينة الطبقية، واستُخدمت قيم SHAP، من خلال TreeExplainer، لتفسير مخرجات النموذج. وصُمِّمت ثلاثة اختبارات للمتانة: اختبار استبعاد أُزيلت فيه جميع سمات GARCH، واختبار عزل استُخدمت فيه سمات GARCH وحدها، واختبار GARCH المتأخر زمنيًا، الذي أُعيد فيه تقدير معلمات التقلب باستخدام أول 70% فقط من السجل التاريخي للعوائد، للتحقُّق من عدم تسرُّب البيانات.

في مجموعة الاختبار المحجوزة، التي تضم 101 شركة لم يسبق للنموذج الاطلاع عليها، حقَّق النموذج الكامل مساحةً تحت منحنى خصائص تشغيل المستقبِل (ROC-AUC) بلغت 0.704، ومعامل ارتباط رتبي لسبيرمان بلغ 0.756، بما يشير إلى قدرة تصنيفية ذات دلالة معلوماتية واتساق قوي في ترتيب المخاطر، بالنسبة إلى نموذج بُني على عدد محدود جدًا من المتغيرات التفسيرية. وأظهر تحليل SHAP أن سمات تقلبات السوق تستأثر بالدور الرئيس في تفسير مخرجات النموذج. فمن بين أهم خمسة متنبئات، تنتمي ثلاثة إلى قناة GARCH، كما تنتمي إليها ثمانية من أهم ثلاثة عشر متنبئًا، وكان المتغير garch_vol_last أقوى المتنبئات، بقيمة SHAP بلغت 0.668، متقدمًا على الرافعة المالية ومؤشر غانينغ فوغ لقابلية القراءة. ومع ذلك، تبيَّن أن التقلب وحده غير كافٍ. فعند استخدام سمات GARCH بمعزل عن غيرها، انخفضت قيمة ROC-AUC انخفاضًا طفيفًا فقط، لتبلغ 0.638، بانخفاض قدره 2.3%، بينما تراجع متوسط الإحكام (Average Precision) بنسبة 20.7% فقط، ليبلغ 0.467؛ وهو ما يُظهر أن التقلب يمثِّل السمة الأعلى قدرةً على التنبؤ في هذه الحالة، حتى في غياب السياق النصي أو المالي. وعند إزالة سمات GARCH بالكامل، يظل مقدار الانخفاض في ROC-AUC عند 0.012 فقط، أي 1.8%، وفي دقة التصنيف عند 7.5%، بما يدل على أن سمات معالجة اللغة الطبيعية والسمات المالية تتمتع بقدرة تمييزية مرتفعة في حد ذاتها، وأن الرافعة المالية، بقيمة 0.662، ومؤشر غانينغ فوغ، بقيمة 0.618، هما أكثر السمات قدرةً على التنبؤ. وقد تفوَّق اختبار المتانة باستخدام GARCH المتأخر زمنيًا، الذي استند إلى معلمات تقلب مقدَّرة من أول 70% فقط من السجل التاريخي للعوائد، على النموذج المرجعي المعاصر؛ إذ بلغت قيمة ROC-AUC نحو 0.704 مقابل 0.653، وبلغ معامل سبيرمان ρ نحو 0.756 مقابل 0.739. ويشير ذلك إلى أن إشارة تقلبات السوق، في حال حدوث تسرُّب للبيانات المستقبلية، لا تمثِّل ظاهرةً مؤقتةً، بل تعكس علاقةً هيكليةً.

تشير النتائج إلى أن مخاطر الغسل الأخضر لا يمكن الإحاطة بها اعتمادًا على مصدر واحد للمعلومات؛ فإشارات تقلبات السوق هي المحركات الرئيسة لأداء ترتيب المخاطر، غير أن السمات النصية والمالية ضرورية أيضًا لتعزيز الإحكام على مستوى قرارات التصنيف وتقليل عدد الحالات الإيجابية الكاذبة. ويؤدي استخدام نماذج متعددة القنوات، تُقيِّم خطاب الشركات وهيكلها المالي واستجابة السوق تقييمًا مشتركًا، إلى تصنيف للغسل الأخضر أكثر موثوقيةً من التصنيف القائم على نموذج أحادي القناة. وتُسهم الدراسة في الأدبيات من وجهين. يتمثَّل الأول في إدخال الباحثين، للمرة الأولى، ديناميات التقلب المستمدة من نماذج GARCH على مستوى الشركات ضمن مُصنِّف لمصداقية ESG، وهو ما يُعد عنصرًا محوريًا في التصور النظري القائل بأن تباين معتقدات المستثمرين بشأن أصالة الممارسات البيئية والاجتماعية والحوكمة ينعكس في التباين الشرطي للعوائد. ويتمثَّل الثاني في أن استقرار النموذج في ترتيب المخاطر يفيد أيضًا في فحص المحافظ الاستثمارية وفق معايير ESG. وقد أجرى الباحثون ثلاثة اختبارات صارمة للمتانة، وأظهروا أن التقلب يُسهم في تحقيق أداء جيد من حيث المساحة تحت المنحنى، في حين يؤثر التعقيد النصي ولغة التحوُّط في دقة التصنيف. وتتسم الدراسة بطابع تنبؤي لا سببي، وتعتمد على مزوِّد واحد لتقييم مخاطر الحوكمة، هو ISS، وعلى تقارير إفصاح بديلة بدلًا من التقارير الكاملة للمسؤولية الاجتماعية للشركات (CSR)، ومشروع الإفصاح عن الكربون (CDP)، وفرقة العمل المعنية بالإفصاحات المالية المتعلقة بالمناخ (TCFD). كما أنها دراسة مقطعية تغطي فترة واحدة (2023–2024)، وتركِّز على الشركات المدرجة في مؤشر S&P 500. ومن ثمَّ، ينبغي إجراء دراسات مستقبلية تستند إلى حالات الغسل الأخضر، ومزوِّدين بديلين لتصنيفات ESG، وبيانات لوحية، وتصاميم بحثية قائمة على المتغيرات الأداتية أو سببية غرانجر، للتحقُّق من السببية وقابلية تعميم النتائج.

الكلمات المفتاحية: الغسل الأخضر، الجوانب البيئية والاجتماعية والحوكمة (ESG)، الضغوط المالية، تعلُّم الآلة، مؤشرات الهيكل المالي.

Résumé structuré:

La majeure partie de la littérature consacrée à la détection de l’écoblanchiment repose presque exclusivement sur les caractéristiques textuelles des informations publiées par les entreprises, laissant largement inexplorée la contribution potentielle des pressions financières à l’échelle de l’entreprise et des signaux de marché. Cette étude vise à élaborer un modèle de détection de l’écoblanchiment fondé sur l’apprentissage automatique, permettant d’évaluer la crédibilité des engagements environnementaux des entreprises du S&P 500 en combinant des informations textuelles, financières et relatives à la volatilité du marché. Plus précisément, nous examinons si l’intégration de la volatilité conditionnelle des rendements boursiers, estimée au moyen de modèles autorégressifs à hétéroscédasticité conditionnelle généralisée (GARCH) et utilisée comme indicateur indirect du scepticisme des investisseurs à l’égard des allégations environnementales des entreprises, améliore les performances de classification lorsqu’elle est associée au traitement automatique du langage naturel (TALN) et aux indicateurs de structure financière, comparativement aux approches exclusivement textuelles. Cette approche multicanale répond à une lacune manifeste de la littérature : aucune étude antérieure n’a combiné les dynamiques de volatilité du marché issues de séries temporelles avec des indicateurs textuels et financiers au sein d’un même classificateur de crédibilité environnementale, sociale et de gouvernance (ESG). Il importe donc de déterminer si le « scepticisme du marché », reflété dans la volatilité, possède un pouvoir explicatif supplémentaire et indépendant, au-delà du langage employé dans les publications et des pressions liées au bilan.

L’étude repose sur un modèle quantitatif et prédictif d’apprentissage automatique appliqué à un échantillon de 503 entreprises du S&P 500, réparties par secteur selon la norme mondiale de classification des secteurs (GICS). Trois canaux indépendants de données ont été construits. Le canal TALN mobilise six caractéristiques extraites des textes publiés par les entreprises, comprenant les pondérations de neuf termes propres à l’ESG calculées selon la méthode de fréquence du terme–fréquence inverse du document (TF-IDF), un score de sentiment fondé sur le lexique de Loughran–McDonald étendu au domaine ESG, les indices de lisibilité de Flesch et de Gunning Fog, le nombre de marqueurs d’atténuation et un score d’écoblanchiment fondé sur ClimateBERT (DistilRoBERTa), avec calibration par mise à l’échelle de la température. Le canal financier intègre cinq caractéristiques : la taille de l’entreprise, la rentabilité des actifs, le ratio de levier financier et la sensibilité sectorielle selon la classification GICS. Le canal de marché utilise dix caractéristiques transversales tirées des données de chaque entreprise à partir d’un modèle GARCH (1,1) spécifique, estimé sur les rendements boursiers quotidiens ; toutefois, nous utilisons une prédiction antérieure à la fenêtre de prévision, compte tenu du risque accru de fuite de ces données. Les 21 caractéristiques obtenues ont été regroupées dans une matrice unique, puis fournies à un classificateur XGBoost. Les hyperparamètres ont été optimisés à l’aide de RandomizedSearchCV, tandis que le déséquilibre entre les classes a été traité par un ajustement dynamique du paramètre scale_pos_weight. La variable dépendante binaire a été construite en appliquant un seuil de percentile dynamique au score ISS Governance QualityScore. Le jeu de données a été divisé selon un ratio de 80/20, soit 402 entreprises pour l’entraînement et 101 pour le test, au moyen d’un échantillonnage stratifié. La méthode SHAP (TreeExplainer) a été utilisée pour assurer l’explicabilité du modèle. Trois tests de robustesse ont été conçus : un test d’ablation, supprimant l’ensemble des caractéristiques GARCH ; un test d’isolement, utilisant uniquement ces caractéristiques ; et un test GARCH décalé dans le temps, dans lequel les paramètres de volatilité sont réestimés exclusivement sur les premiers 70 % de l’historique des rendements, afin de vérifier l’absence de fuite de données.

Sur le jeu de test réservé, composé de 101 entreprises non observées auparavant par le modèle, le modèle complet atteint une aire sous la courbe ROC (ROC-AUC) de 0,704 et une corrélation des rangs de Spearman de 0,756. Ces résultats témoignent d’une capacité de classification informative et d’une forte cohérence dans le classement des risques pour un modèle reposant sur un nombre très limité de variables explicatives. L’analyse SHAP montre que les caractéristiques de volatilité du marché occupent une place centrale dans l’explication des sorties du modèle. Trois des cinq principaux prédicteurs et huit des treize prédicteurs les plus importants proviennent du canal GARCH ; garch_vol_last constitue le prédicteur le plus influent (SHAP = 0,668), devant le levier financier et l’indice de lisibilité de Gunning Fog. Toutefois, nous constatons que la volatilité seule ne suffit pas. Lorsque les caractéristiques GARCH sont utilisées isolément, la ROC-AUC n’est que légèrement inférieure (0,638 ; −2,3 %), tandis que la précision moyenne (Average Precision) ne diminue que de 20,7 %, pour s’établir à 0,467. Ce résultat indique que la volatilité constitue, dans ce cas, la caractéristique la plus prédictive, même en l’absence de contexte textuel ou financier. Lorsque les caractéristiques GARCH sont entièrement supprimées, la diminution de la ROC-AUC demeure limitée à 0,012 (1,8 %) et celle de l’exactitude de classification à 7,5 %, ce qui indique que les caractéristiques TALN et financières possèdent, à elles seules, un fort pouvoir discriminant ; le levier financier (0,662) et l’indice de Gunning Fog (0,618) sont alors les caractéristiques les plus prédictives. Le test de robustesse GARCH décalé dans le temps, fondé sur des paramètres de volatilité estimés uniquement à partir des premiers 70 % de l’historique des rendements, surpasse le modèle de référence contemporain (ROC-AUC de 0,704 contre 0,653 ; ρ de Spearman de 0,756 contre 0,739). Cela indique que, si une fuite de données futures se produit, le signal de volatilité du marché n’est pas temporaire, mais reflète plutôt une relation structurelle.

Les résultats suggèrent que le risque d’écoblanchiment ne peut être appréhendé à partir d’une seule source d’information : les signaux de volatilité du marché constituent les principaux déterminants de la performance de classement, mais les caractéristiques textuelles et financières sont également nécessaires pour améliorer la précision des décisions de classification et réduire le nombre de faux positifs. L’utilisation de modèles multicanaux évaluant conjointement le discours des entreprises, leur structure financière et la réaction du marché permet d’obtenir une classification de l’écoblanchiment plus fiable que celle issue d’un modèle à canal unique. L’étude apporte deux contributions à la littérature. Premièrement, les auteurs introduisent, pour la première fois, des dynamiques de volatilité dérivées de modèles GARCH à l’échelle de l’entreprise dans un classificateur de crédibilité ESG. Cette contribution est centrale pour la proposition théorique selon laquelle l’hétérogénéité des croyances des investisseurs quant à l’authenticité des pratiques ESG se reflète dans la variance conditionnelle des rendements. Deuxièmement, la stabilité du modèle en matière de classement présente également un intérêt pour le filtrage des portefeuilles selon des critères ESG. Les auteurs ont réalisé trois tests de robustesse rigoureux et montré que la volatilité contribue à une bonne performance en matière d’AUC, tandis que la complexité textuelle et les marqueurs d’atténuation influencent l’exactitude de classification. L’étude est prédictive plutôt que causale et repose sur un seul fournisseur d’évaluations du risque de gouvernance (ISS), ainsi que sur des rapports de divulgation utilisés comme substituts, plutôt que sur des rapports complets de responsabilité sociale des entreprises (CSR), du Carbon Disclosure Project (CDP) ou de la Task Force on Climate-related Financial Disclosures (TCFD). Il s’agit d’une étude transversale couvrant une seule période (2023–2024) et centrée sur les entreprises du S&P 500. Des recherches futures mobilisant des cas d’écoblanchiment, d’autres fournisseurs de notations ESG, des données de panel et des dispositifs méthodologiques fondés sur les variables instrumentales ou la causalité au sens de Granger devraient donc être menées afin d’établir la causalité et la généralisabilité des résultats.

 

Mots-clés : Écoblanchiment, ESG, pression financière, apprentissage automatique, indicateurs de structure financière.

Resumen estructurado:

La mayor parte de la literatura existente sobre la detección del lavado verde (greenwashing) se basa casi exclusivamente en las características textuales de la información divulgada, mientras que la posible contribución de las presiones financieras a nivel empresarial y de las señales de mercado permanece, en gran medida, inexplorada. Este estudio tiene como objetivo desarrollar un modelo de detección del lavado verde basado en aprendizaje automático que evalúe la credibilidad de los compromisos ambientales de las empresas del S&P 500 mediante la integración de información textual, financiera y relativa a la volatilidad del mercado. Específicamente, se examina si la incorporación de la volatilidad condicional de los rendimientos bursátiles, estimada mediante modelos de heterocedasticidad condicional autorregresiva generalizada (GARCH), como variable sustitutiva del escepticismo de los inversores ante las declaraciones ambientales corporativas, junto con indicadores de procesamiento del lenguaje natural (PLN) y de estructura financiera, mejora el desempeño de clasificación frente a los enfoques exclusivamente textuales. Esta aproximación multicanal aborda una laguna manifiesta en la literatura: ningún estudio previo ha integrado las dinámicas de volatilidad del mercado observadas en series temporales con indicadores textuales y financieros en un único clasificador de credibilidad ambiental, social y de gobernanza (ESG). Por consiguiente, resulta pertinente comprobar si el «escepticismo del mercado» reflejado en la volatilidad posee una capacidad explicativa adicional e independiente respecto del lenguaje de divulgación y de las presiones del balance.

El estudio adopta un enfoque cuantitativo y predictivo basado en aprendizaje automático, aplicado a una muestra de 503 empresas del S&P 500, clasificadas por sector conforme al Estándar Global de Clasificación Industrial (GICS). Se construyeron tres canales independientes de datos. El canal de PLN utiliza seis características extraídas de los textos de divulgación corporativa, entre ellas las ponderaciones de nueve términos específicos de ESG calculadas mediante la frecuencia de término–frecuencia inversa de documento (TF-IDF), una puntuación de sentimiento basada en el léxico de Loughran–McDonald ampliado al ámbito ESG, los índices de legibilidad de Flesch y Gunning Fog, el recuento de expresiones de atenuación y una puntuación de lavado verde basada en ClimateBERT (DistilRoBERTa), calibrada mediante escalado de temperatura. El canal financiero incorpora cinco características: tamaño de la empresa, rentabilidad sobre los activos, ratio de apalancamiento y sensibilidad sectorial según el GICS. El canal de mercado utiliza diez características transversales obtenidas de los datos de cada empresa mediante un modelo GARCH (1,1) específico, estimado a partir de los rendimientos bursátiles diarios; no obstante, se utiliza una predicción anterior a la ventana de pronóstico, dada la mayor probabilidad de filtración de esos datos. Las 21 características resultantes se integraron en una única matriz y se introdujeron en un clasificador XGBoost, cuyos hiperparámetros se ajustaron mediante RandomizedSearchCV. El desequilibrio entre clases se abordó mediante un ajuste dinámico del parámetro scale_pos_weight. La variable dependiente binaria se construyó aplicando un umbral percentilar dinámico al ISS Governance QualityScore. El conjunto de datos se dividió en una proporción de 80/20, con 402 empresas para entrenamiento y 101 para prueba, mediante muestreo estratificado, y se utilizó SHAP (TreeExplainer) para interpretar las predicciones. Se diseñaron tres pruebas de robustez: una prueba de ablación, en la que se eliminaron todas las características GARCH; una prueba de aislamiento, que utilizó exclusivamente dichas características; y una prueba con GARCH rezagado, en la que los parámetros de volatilidad se reestimaron utilizando únicamente el primer 70 % del historial de rendimientos, como comprobación frente a la filtración de datos.

En el conjunto de prueba reservado, compuesto por 101 empresas no observadas previamente por el modelo, el modelo completo alcanza un área bajo la curva ROC (ROC-AUC) de 0,704 y una correlación de rangos de Spearman de 0,756. Estos resultados indican una capacidad de clasificación informativa y una elevada consistencia en la ordenación del riesgo para un modelo construido con un número muy reducido de variables explicativas. El análisis SHAP mostró que las características de volatilidad del mercado ocupan una posición central en la explicación de los resultados del modelo. Tres de los cinco principales predictores y ocho de los trece más relevantes proceden del canal GARCH; garch_vol_last constituye el predictor más influyente (SHAP = 0,668), por delante del apalancamiento y de la legibilidad medida mediante Gunning Fog. Sin embargo, los resultados muestran que la volatilidad por sí sola no es suficiente. Cuando las características GARCH se utilizan de forma aislada, el ROC-AUC es solo ligeramente inferior (0,638; −2,3 %), mientras que la precisión promedio (Average Precision) disminuye únicamente un 20,7 %, hasta situarse en 0,467. Esto indica que la volatilidad constituye la característica con mayor capacidad predictiva en este caso, incluso en ausencia de contexto textual o financiero. Cuando las características GARCH se eliminan por completo, la disminución del ROC-AUC sigue siendo de tan solo 0,012 (1,8 %) y la de la exactitud de clasificación es del 7,5 %, lo que indica que las características de PLN y las financieras poseen, por sí mismas, una elevada capacidad discriminativa; el apalancamiento (0,662) y Gunning Fog (0,618) son los predictores más relevantes. La prueba de robustez con GARCH rezagado, cuyos parámetros de volatilidad se estimaron utilizando únicamente el primer 70 % del historial de rendimientos, superó al modelo de referencia contemporáneo (ROC-AUC de 0,704 frente a 0,653; ρ de Spearman de 0,756 frente a 0,739). Ello indica que, si se produce una filtración de información futura, la señal de volatilidad del mercado no es transitoria, sino que refleja una relación estructural.

Los resultados sugieren que el riesgo de lavado verde no puede captarse mediante una única fuente de información: las señales de volatilidad del mercado son los principales determinantes del desempeño en la ordenación del riesgo, pero las características textuales y financieras también son necesarias para mejorar la precisión de las decisiones de clasificación y reducir el número de falsos positivos. El uso de modelos multicanal que evalúan conjuntamente el discurso corporativo, la estructura financiera y la respuesta del mercado permite obtener una clasificación del lavado verde más fiable que la proporcionada por un modelo de un solo canal. El estudio contribuye a la literatura de dos maneras. En primer lugar, los autores incorporan, por primera vez, dinámicas de volatilidad derivadas de modelos GARCH a nivel empresarial en un clasificador de credibilidad ESG, un elemento central para el planteamiento teórico según el cual la heterogeneidad de las creencias de los inversores sobre la autenticidad de las prácticas ESG se refleja en la varianza condicional de los rendimientos. En segundo lugar, la estabilidad del modelo en la ordenación del riesgo también resulta útil para la selección de activos en carteras conforme a criterios ESG. Los autores realizaron tres pruebas rigurosas de robustez y demostraron que la volatilidad contribuye a un buen desempeño en términos de AUC, mientras que la complejidad textual y el lenguaje de atenuación influyen en la exactitud de clasificación. El estudio es predictivo, no causal, y se basa en un único proveedor de evaluaciones del riesgo de gobernanza (ISS) y en informes de divulgación utilizados como aproximaciones, en lugar de informes completos de responsabilidad social corporativa (CSR), del Proyecto de Divulgación de Carbono (CDP) o del Grupo de Trabajo sobre Divulgaciones Financieras Relacionadas con el Clima (TCFD). Asimismo, se trata de un estudio transversal correspondiente a un único período (2023–2024), centrado en empresas del S&P 500. Por tanto, se requieren investigaciones futuras que utilicen casos de lavado verde, proveedores alternativos de calificaciones ESG, datos de panel y diseños basados en variables instrumentales o en causalidad de Granger, con el fin de establecer la causalidad y la generalizabilidad de los resultados.

 

Palabras clave: Lavado verde, ESG, presión financiera, aprendizaje automático, indicadores de estructura financiera.

结构化摘要

现有关于漂绿识别的研究几乎完全依赖企业披露文本的特征,而企业层面的财务压力及市场信号可能发挥的作用,在很大程度上尚未得到充分探讨。本研究旨在构建一个基于机器学习的漂绿识别模型,通过整合文本信息、财务信息与市场波动信息,评估标普500指数成分企业所作环境承诺的可信度。具体而言,本研究考察:在自然语言处理(NLP)特征和财务结构指标的基础上,引入基于广义自回归条件异方差(GARCH)模型估计的股票收益条件波动率,并将其作为投资者对企业环境声明持怀疑态度的代理变量,是否能够较仅使用文本信息的方法提升分类性能。这一多通道方法旨在填补现有文献中的显著空白:此前尚无研究在单一环境、社会与治理(ESG)可信度分类器中,将市场波动的时间序列动态与文本及财务指标相结合。因此,有必要检验波动率所反映的“市场怀疑”是否具有超越披露语言与资产负债表压力的额外且独立的解释力。

本研究采用定量、预测性的机器学习模型,以503家标普500指数成分企业为样本,并依据全球行业分类标准(GICS)对其进行行业分类。研究构建了三个相互独立的数据通道。NLP通道使用从企业披露文本中提取的六项特征,包括基于词频—逆文档频率(TF-IDF)计算的九个ESG专用术语权重、基于扩展至ESG领域的Loughran–McDonald词典计算的情感得分、Flesch与Gunning Fog可读性指数、模糊限制语词数,以及基于ClimateBERT(DistilRoBERTa)并采用温度缩放进行校准的漂绿得分。财务通道纳入五项特征,即企业规模、资产收益率、财务杠杆率及基于GICS分类的行业敏感性。市场通道利用各企业的数据提取十项横截面特征,这些特征基于企业特定的GARCH(1,1)模型,并使用股票日收益率进行估计;不过,鉴于相关数据更容易发生泄漏,本研究使用预测窗口之前的预测结果。由此得到的21项特征被整合为一个统一矩阵,并输入XGBoost分类器;模型超参数通过RandomizedSearchCV进行调优,类别不平衡问题则通过动态调整scale_pos_weight参数加以处理。二元因变量通过对ISS Governance QualityScore应用动态百分位数阈值构建。研究采用分层抽样,将数据集按80/20的比例划分为训练集和测试集,分别包含402家和101家企业,并使用SHAP(TreeExplainer)解释模型输出。研究设计了三项稳健性检验:一是消融检验,移除全部GARCH特征;二是独立通道检验,仅使用GARCH特征;三是滞后GARCH检验,仅使用收益率历史序列前70%的数据重新估计波动参数,以检验是否存在数据泄漏。

在包含101家模型此前未见企业的留出测试集上,完整模型的受试者工作特征曲线下面积(ROC-AUC)为0.704,Spearman秩相关系数为0.756。对于一个仅由极少量解释变量构建的模型而言,这些结果表明其具有一定的分类信息价值,并在风险排序方面表现出较强的一致性。SHAP分析显示,市场波动特征在解释模型输出时占据核心地位。重要性排名前五的预测变量中,有三个来自GARCH通道;排名前十三的预测变量中,有八个来自该通道。其中,garch_vol_last是最具预测力的变量(SHAP = 0.668),其重要性高于财务杠杆和Gunning Fog可读性指标。然而,研究发现,仅依靠波动率并不足够。当单独使用GARCH特征时,ROC-AUC仅略有下降,为0.638,降幅为2.3%;平均精确率(Average Precision)则仅下降20.7%,降至0.467。这表明,即使缺乏文本或财务背景信息,波动率在此情形下仍是最具预测力的特征。当完全移除GARCH特征时,ROC-AUC的降幅仍仅为0.012(1.8%),分类准确率的降幅为7.5%,说明NLP特征与财务特征本身也具有较强的区分能力,其中财务杠杆(0.662)和Gunning Fog指数(0.618)是最具预测力的特征。滞后GARCH稳健性检验仅使用收益率历史序列前70%的数据估计波动参数,其表现优于同期基准模型:ROC-AUC分别为0.704和0.653,Spearman秩相关系数ρ分别为0.756和0.739。这表明,如果存在未来信息泄漏,市场波动信号并非暂时性现象,而是反映了一种结构性关系。

研究结果表明,仅凭单一信息来源无法充分捕捉漂绿风险:市场波动信号是风险排序性能的主要驱动因素,但文本和财务特征同样不可或缺,有助于提高分类决策层面的精确率并减少假阳性数量。采用同时评估企业话语、财务结构与市场反应的多通道模型,能够获得比单通道模型更可靠的漂绿分类结果。本研究从两个方面拓展了现有文献。第一,作者首次将企业层面基于GARCH模型提取的波动动态引入ESG可信度分类器。这对于以下理论命题具有关键意义:投资者对ESG真实性的信念存在异质性,而这种异质性会反映在收益率的条件方差中。第二,模型在风险排序方面的稳定性,也有助于开展投资组合的ESG筛选。作者实施了三项严格的稳健性检验,并表明波动率有助于取得良好的AUC表现,而文本复杂性与模糊限制性语言则影响分类准确率。本研究属于预测性研究,而非因果研究;其依赖单一治理风险评估提供商ISS,并使用替代性披露报告,而非完整的企业社会责任(CSR)报告、碳信息披露项目(CDP)报告或气候相关财务信息披露工作组(TCFD)报告。此外,本研究是一项覆盖单一时期(2023—2024年)的横截面研究,研究对象仅限于标普500指数成分企业。未来应结合漂绿案例、其他ESG评级提供商的数据、面板数据,以及工具变量或格兰杰因果关系研究设计,进一步确立因果关系并检验研究结论的可推广性。

 

关键词: 漂绿、环境社会与治理(ESG)、财务压力、机器学习、财务结构指标。

Структурированная аннотация

Большинство существующих исследований, посвящённых выявлению гринвошинга, опирается почти исключительно на текстовые характеристики раскрываемой корпоративной информации, тогда как потенциальный вклад финансового давления на уровне компаний и рыночных сигналов остаётся в значительной степени неизученным. Цель настоящего исследования — разработать модель выявления гринвошинга на основе машинного обучения, позволяющую оценивать достоверность экологических обязательств компаний, входящих в индекс S&P 500, посредством объединения текстовой, финансовой информации и данных о рыночной волатильности. В частности, исследуется, позволяет ли включение условной волатильности доходности акций, оцениваемой с помощью моделей обобщённой авторегрессионной условной гетероскедастичности (GARCH) и используемой в качестве прокси-показателя скептицизма инвесторов в отношении экологических заявлений компаний, наряду с признаками обработки естественного языка (NLP) и показателями финансовой структуры, повысить качество классификации по сравнению с подходами, основанными исключительно на текстовых данных. Этот многоканальный подход направлен на восполнение существенного пробела в литературе: ранее ни одно исследование не объединяло динамику рыночной волатильности, представленную временными рядами, с текстовыми и финансовыми показателями в рамках единого классификатора достоверности экологических, социальных и управленческих характеристик (ESG). Поэтому важно проверить, обладает ли «рыночный скептицизм», отражённый в волатильности, дополнительной и независимой объясняющей способностью сверх той, которую обеспечивают язык раскрытия информации и финансовое давление, отражаемое в бухгалтерском балансе.

Исследование основано на количественной прогнозной модели машинного обучения, применённой к выборке из 503 компаний индекса S&P 500, распределённых по секторам в соответствии с Глобальным стандартом отраслевой классификации (GICS). Были сформированы три независимых канала данных. Канал NLP использует шесть признаков, извлечённых из текстов корпоративных раскрытий, включая веса девяти специализированных терминов ESG, рассчитанные методом «частота термина — обратная частота документа» (TF-IDF), оценку тональности на основе словаря Лоурана — Макдональда, расширенного для охвата терминологии ESG, индексы удобочитаемости Флеша и Ганнинга — Фога, количество маркеров лингвистического хеджирования, а также оценку гринвошинга на основе ClimateBERT (DistilRoBERTa) с применением температурного масштабирования. Финансовый канал включает пять признаков: размер компании, рентабельность активов, коэффициент финансового рычага и отраслевую чувствительность согласно классификации GICS. Рыночный канал использует десять признаков поперечного среза, полученных из данных каждой компании на основе индивидуальной модели GARCH (1,1), оценённой по ежедневной доходности акций; при этом используется прогноз, сформированный до начала прогнозного окна, поскольку соответствующие данные в большей степени подвержены риску утечки. Полученный 21 признак был объединён в единую матрицу и передан классификатору XGBoost. Гиперпараметры настраивались с помощью RandomizedSearchCV, а дисбаланс классов учитывался посредством динамической корректировки параметра scale_pos_weight. Бинарная зависимая переменная была сформирована путём применения динамического процентильного порога к показателю ISS Governance QualityScore. Набор данных был разделён в соотношении 80/20 посредством стратифицированной выборки: 402 компании вошли в обучающую выборку, а 101 — в тестовую. Для интерпретации модели использовался метод SHAP (TreeExplainer). Были разработаны три проверки устойчивости: абляционный тест с исключением всех признаков GARCH; тест изолированного использования, включающий только признаки GARCH; и тест с лагированным GARCH, в котором параметры волатильности переоценивались исключительно на первых 70 % исторического ряда доходности для проверки отсутствия утечки данных.

На отложенной тестовой выборке из 101 компании, ранее не представленной модели, полная модель достигает значения площади под ROC-кривой (ROC-AUC), равного 0,704, и коэффициента ранговой корреляции Спирмена, равного 0,756. Эти результаты свидетельствуют об информативности классификации и высокой согласованности ранжирования рисков для модели, построенной на весьма ограниченном числе объясняющих переменных. Анализ SHAP показал, что признаки рыночной волатильности занимают центральное место в объяснении результатов модели. Три из пяти и восемь из тринадцати наиболее значимых предикторов относятся к каналу GARCH; наиболее сильным предиктором является garch_vol_last (SHAP = 0,668), опережающий финансовый рычаг и индекс удобочитаемости Ганнинга — Фога. Вместе с тем установлено, что одной волатильности недостаточно. При изолированном использовании признаков GARCH значение ROC-AUC снижается лишь незначительно — до 0,638 (−2,3 %), тогда как средняя точность положительных предсказаний (Average Precision) уменьшается лишь на 20,7 %, до 0,467. Это показывает, что в данном случае волатильность обладает наибольшей прогностической способностью даже при отсутствии текстового или финансового контекста. При полном исключении признаков GARCH снижение ROC-AUC по-прежнему составляет всего 0,012 (1,8 %), а снижение доли правильных классификаций — 7,5 %. Это указывает на высокую самостоятельную различающую способность признаков NLP и финансовых показателей; наиболее сильными предикторами при этом выступают финансовый рычаг (0,662) и индекс Ганнинга — Фога (0,618). Проверка устойчивости с лагированным GARCH, использующая параметры волатильности, оценённые только по первым 70 % исторического ряда доходности, продемонстрировала превосходство над базовой моделью с текущими оценками (ROC-AUC: 0,704 против 0,653; коэффициент Спирмена ρ: 0,756 против 0,739). Это указывает на то, что в случае утечки будущих данных сигнал рыночной волатильности представляет собой не временное явление, а структурную взаимосвязь.

Результаты свидетельствуют о том, что риск гринвошинга невозможно в полной мере выявить на основе единственного источника информации: сигналы рыночной волатильности являются основными факторами, определяющими качество ранжирования, однако текстовые и финансовые признаки также необходимы для повышения точности положительных предсказаний на уровне классификационных решений и сокращения числа ложноположительных результатов. Применение многоканальных моделей, совместно оценивающих корпоративный дискурс, финансовую структуру и реакцию рынка, позволяет получить более надёжную классификацию гринвошинга по сравнению с одноканальной моделью. Исследование вносит вклад в литературу по двум направлениям. Во-первых, авторы впервые включают динамику волатильности на уровне компаний, полученную на основе моделей GARCH, в классификатор достоверности ESG. Это имеет ключевое значение для теоретического положения о том, что неоднородность убеждений инвесторов относительно подлинности практик ESG отражается в условной дисперсии доходности. Во-вторых, устойчивость модели в ранжировании рисков также полезна для отбора активов в инвестиционные портфели по критериям ESG. Авторы провели три строгие проверки устойчивости и показали, что волатильность способствует достижению высоких значений AUC, тогда как текстовая сложность и средства лингвистического хеджирования влияют на долю правильных классификаций. Исследование носит прогностический, а не причинно-объяснительный характер и опирается на единственного поставщика оценок рисков корпоративного управления — ISS, а также на отчёты о раскрытии информации, используемые в качестве заменителей, вместо полных отчётов по корпоративной социальной ответственности (CSR), Проекту раскрытия информации о выбросах углерода (CDP) и рекомендациям Рабочей группы по раскрытию финансовой информации, связанной с климатом (TCFD). Кроме того, это исследование поперечного среза, охватывающее один период (2023–2024 гг.) и ограниченное компаниями индекса S&P 500. Для установления причинно-следственных связей и обобщаемости результатов необходимы дальнейшие исследования с использованием случаев гринвошинга, данных альтернативных поставщиков рейтингов ESG, панельных данных, а также исследовательских дизайнов, основанных на инструментальных переменных или причинности по Грейнджеру.

 

Ключевые слова: гринвошинг, ESG, финансовое давление, машинное обучение, показатели финансовой структуры.

संरचित सार

ग्रीनवॉशिंग की पहचान से संबंधित अधिकांश मौजूदा साहित्य लगभग पूर्णतः प्रकटीकरण की पाठगत विशेषताओं पर निर्भर करता है, जबकि कंपनी-स्तरीय वित्तीय दबाव और बाज़ार-आधारित संकेतों के संभावित योगदान का पर्याप्त परीक्षण नहीं किया गया है। इस अध्ययन का उद्देश्य मशीन लर्निंग पर आधारित एक ग्रीनवॉशिंग पहचान मॉडल विकसित करना है, जो पाठगत, वित्तीय और बाज़ार अस्थिरता संबंधी सूचनाओं को संयोजित करके S&P 500 कंपनियों द्वारा व्यक्त पर्यावरणीय प्रतिबद्धताओं की विश्वसनीयता का मूल्यांकन करे। विशेष रूप से, हम यह जाँचते हैं कि प्राकृतिक भाषा प्रसंस्करण (NLP) तथा वित्तीय संरचना के संकेतकों के साथ, कॉर्पोरेट पर्यावरणीय दावों के प्रति निवेशकों के संशय के परोक्ष संकेतक के रूप में GARCH-आधारित सशर्त शेयर प्रतिफल अस्थिरता को सम्मिलित करने से, केवल पाठ पर आधारित दृष्टिकोणों की तुलना में वर्गीकरण निष्पादन में सुधार होता है या नहीं। यह बहु-चैनल दृष्टिकोण साहित्य में विद्यमान एक स्पष्ट शोध-अंतराल को संबोधित करता है: किसी पूर्व अध्ययन ने एक ही पर्यावरणीय, सामाजिक एवं शासन-संबंधी (ESG) विश्वसनीयता वर्गीकारक में काल-श्रृंखला आधारित बाज़ार अस्थिरता की गतिशीलता को पाठगत और वित्तीय संकेतकों के साथ संयोजित नहीं किया है। अतः यह परीक्षण करना महत्त्वपूर्ण है कि अस्थिरता में परिलक्षित “बाज़ार संशय” में प्रकटीकरण की भाषा और तुलन-पत्र संबंधी दबाव से परे कोई अतिरिक्त एवं स्वतंत्र व्याख्यात्मक क्षमता है या नहीं।

यह अध्ययन एक मात्रात्मक और पूर्वानुमानपरक मशीन लर्निंग मॉडल पर आधारित है, जिसे S&P 500 की 503 कंपनियों के नमूने पर लागू किया गया है। इन कंपनियों को वैश्विक उद्योग वर्गीकरण मानक (GICS) के अनुसार क्षेत्रवार वर्गीकृत किया गया है। हमने तीन स्वतंत्र डेटा चैनल निर्मित किए। NLP चैनल में कंपनियों के प्रकटीकरण पाठों से प्राप्त छह विशेषताओं का उपयोग किया गया है। इनमें पद आवृत्ति–प्रतिलोम दस्तावेज़ आवृत्ति (TF-IDF) के आधार पर निर्धारित नौ ESG-विशिष्ट पदों के भार, ESG शब्दावली तक विस्तारित Loughran–McDonald शब्दकोश पर आधारित भाव-विश्लेषण स्कोर, Flesch और Gunning Fog पठनीयता सूचकांक, भाषिक संकोच एवं सावधानी दर्शाने वाले शब्दों की संख्या, तथा तापमान स्केलिंग के माध्यम से अंशांकित ClimateBERT (DistilRoBERTa)-आधारित ग्रीनवॉशिंग स्कोर सम्मिलित हैं। वित्तीय चैनल में पाँच विशेषताएँ शामिल की गई हैं: कंपनी का आकार, परिसंपत्तियों पर प्रतिफल, वित्तीय उत्तोलन अनुपात और GICS के अनुसार क्षेत्रगत संवेदनशीलता। बाज़ार चैनल में प्रत्येक कंपनी के डेटा से प्राप्त दस अनुप्रस्थ विशेषताओं का उपयोग किया गया है, जो दैनिक शेयर प्रतिफलों के आधार पर अनुमानित कंपनी-विशिष्ट GARCH (1,1) मॉडल पर आधारित हैं; हालाँकि, संबंधित डेटा के लीक होने की अधिक संभावना को देखते हुए, हम पूर्वानुमान अवधि से पहले के पूर्वानुमान का उपयोग करते हैं। इस प्रकार प्राप्त 21 विशेषताओं को एकल आव्यूह में एकीकृत कर XGBoost वर्गीकारक में प्रविष्ट किया गया। हाइपरपैरामीटरों का समायोजन RandomizedSearchCV द्वारा किया गया, जबकि वर्ग-असंतुलन को scale_pos_weight के गतिशील समायोजन के माध्यम से संबोधित किया गया। द्विआधारी आश्रित चर का निर्माण ISS Governance QualityScore पर एक गतिशील प्रतिशतक सीमा लागू करके किया गया। स्तरीकृत प्रतिचयन द्वारा डेटासेट को 80/20 के अनुपात में विभाजित किया गया, जिसमें प्रशिक्षण के लिए 402 और परीक्षण के लिए 101 कंपनियाँ रखी गईं। मॉडल की व्याख्येयता के लिए SHAP (TreeExplainer) का उपयोग किया गया। तीन सुदृढ़ता परीक्षण तैयार किए गए: एक विलोपन परीक्षण, जिसमें सभी GARCH विशेषताओं को हटा दिया गया; एक पृथक परीक्षण, जिसमें केवल GARCH विशेषताओं का उपयोग किया गया; और एक समय-पश्चित GARCH परीक्षण, जिसमें डेटा रिसाव की जाँच के लिए प्रतिफलों के ऐतिहासिक अभिलेख के केवल प्रारंभिक 70% भाग पर अस्थिरता प्राचलों का पुनः आकलन किया गया।

मॉडल के लिए पूर्वतः अपरिचित 101 कंपनियों के पृथक रखे गए परीक्षण समुच्चय पर पूर्ण मॉडल ने 0.704 का ROC वक्र के अंतर्गत क्षेत्रफल (ROC-AUC) और 0.756 का स्पीयरमैन कोटि सहसंबंध प्राप्त किया। अत्यंत सीमित संख्या में व्याख्यात्मक चरों पर निर्मित मॉडल के संदर्भ में, ये परिणाम सूचनाप्रद वर्गीकरण क्षमता और जोखिम क्रम-निर्धारण में उच्च संगति दर्शाते हैं। SHAP विश्लेषण से स्पष्ट हुआ कि बाज़ार अस्थिरता संबंधी विशेषताएँ मॉडल के निर्गमों की व्याख्या में केंद्रीय भूमिका निभाती हैं। पाँच सर्वाधिक महत्त्वपूर्ण पूर्वानुमानकों में से तीन और तेरह सर्वाधिक महत्त्वपूर्ण पूर्वानुमानकों में से आठ GARCH चैनल से संबंधित हैं। इनमें garch_vol_last सबसे प्रभावशाली पूर्वानुमानक है (SHAP = 0.668), जिसका स्थान वित्तीय उत्तोलन और Gunning Fog पठनीयता से ऊपर है। तथापि, हमने पाया कि केवल अस्थिरता पर्याप्त नहीं है। जब GARCH विशेषताओं का पृथक रूप से उपयोग किया जाता है, तो ROC-AUC केवल थोड़ा कम होता है (0.638; −2.3%), जबकि औसत परिशुद्धता (Average Precision) केवल 20.7% घटकर 0.467 रह जाती है। इससे संकेत मिलता है कि पाठगत या वित्तीय संदर्भ के अभाव में भी, इस स्थिति में अस्थिरता सर्वाधिक पूर्वानुमानकारी विशेषता है। जब GARCH विशेषताओं को पूरी तरह हटा दिया जाता है, तब भी ROC-AUC में गिरावट केवल 0.012 (1.8%) और वर्गीकरण सटीकता में गिरावट 7.5% रहती है। यह दर्शाता है कि NLP और वित्तीय विशेषताएँ अपने आप में उच्च विभेदकारी क्षमता रखती हैं, तथा वित्तीय उत्तोलन (0.662) और Gunning Fog (0.618) सर्वाधिक पूर्वानुमानकारी विशेषताएँ हैं। प्रतिफलों के ऐतिहासिक अभिलेख के केवल प्रारंभिक 70% भाग से अनुमानित अस्थिरता प्राचलों का उपयोग करने वाले समय-पश्चित GARCH सुदृढ़ता परीक्षण ने समकालीन आधाररेखा मॉडल से बेहतर निष्पादन किया (ROC-AUC: 0.704 बनाम 0.653; स्पीयरमैन ρ: 0.756 बनाम 0.739)। इससे संकेत मिलता है कि यदि भविष्य की सूचना का रिसाव होता है, तो बाज़ार अस्थिरता का संकेत अस्थायी न होकर एक संरचनात्मक संबंध को प्रतिबिंबित करता है।

परिणाम दर्शाते हैं कि ग्रीनवॉशिंग जोखिम को किसी एक सूचना स्रोत के माध्यम से पूर्णतः नहीं समझा जा सकता। बाज़ार अस्थिरता के संकेत जोखिम क्रम-निर्धारण के निष्पादन के प्रमुख प्रेरक हैं, किंतु वर्गीकरण निर्णयों के स्तर पर परिशुद्धता बढ़ाने और मिथ्या सकारात्मक परिणामों की संख्या कम करने के लिए पाठगत तथा वित्तीय विशेषताएँ भी आवश्यक हैं। कॉर्पोरेट विमर्श, वित्तीय संरचना और बाज़ार प्रतिक्रिया का संयुक्त मूल्यांकन करने वाले बहु-चैनल मॉडलों का उपयोग, एकल-चैनल मॉडल की तुलना में अधिक विश्वसनीय ग्रीनवॉशिंग वर्गीकरण प्रदान करता है। यह अध्ययन साहित्य में दो प्रकार से योगदान देता है। पहला, लेखकों ने पहली बार कंपनी-स्तरीय GARCH-व्युत्पन्न अस्थिरता की गतिशीलता को ESG विश्वसनीयता वर्गीकारक में सम्मिलित किया है। यह उस सैद्धांतिक प्रतिपादन के लिए महत्त्वपूर्ण है जिसके अनुसार ESG प्रामाणिकता के संबंध में निवेशकों की धारणाओं की विषमता प्रतिफलों के सशर्त प्रसरण में परिलक्षित होती है। दूसरा, जोखिम क्रम-निर्धारण में मॉडल की स्थिरता निवेश पोर्टफोलियो की ESG-आधारित छँटाई के लिए भी उपयोगी है। लेखकों ने तीन कठोर सुदृढ़ता परीक्षण किए और प्रदर्शित किया कि अस्थिरता अच्छे AUC निष्पादन में योगदान देती है, जबकि पाठगत जटिलता तथा भाषिक संकोच एवं सावधानी दर्शाने वाली अभिव्यक्तियाँ वर्गीकरण सटीकता को प्रभावित करती हैं। यह अध्ययन कारणात्मक के बजाय पूर्वानुमानपरक है और शासन-संबंधी जोखिम के एकमात्र मूल्यांकन प्रदाता, ISS, पर निर्भर करता है। साथ ही, इसमें कॉर्पोरेट सामाजिक उत्तरदायित्व (CSR), कार्बन प्रकटीकरण परियोजना (CDP) और जलवायु-संबंधी वित्तीय प्रकटीकरण कार्यबल (TCFD) की संपूर्ण रिपोर्टों के स्थान पर वैकल्पिक प्रकटीकरण रिपोर्टों का उपयोग किया गया है। यह S&P 500 कंपनियों पर केंद्रित, एकल अवधि (2023–2024) को समेटने वाला अनुप्रस्थ अध्ययन है। अतः कारणात्मकता और निष्कर्षों की सामान्यीकरणीयता स्थापित करने के लिए भविष्य के अध्ययनों में ग्रीनवॉशिंग के मामलों, वैकल्पिक ESG रेटिंग प्रदाताओं, पैनल डेटा तथा साधनात्मक चरों या ग्रेंजर कारणात्मकता पर आधारित शोध अभिकल्पों का उपयोग किया जाना चाहिए।

 

मुख्य शब्द: ग्रीनवॉशिंग, ESG, वित्तीय दबाव, मशीन लर्निंग, वित्तीय संरचना संकेतक।

Article Statistics

Number of reads 141
Number of downloads 28

Share

Turkish Studies-Economics,Finance,Politics
E-Mail Subscription

By subscribing to E-Newsletter, you can get the latest news to your e-mail.