Birkaç hafta önce Meta çalışanlarının Claudeonomics adlı bir şirket içi liderlik tablosunda sıralandığı haberi çıktı. Ölçüt basitti: kim kaç yapay zeka tokenı tüketti? En üsttekiler "Token Legend" ve "Session Immortal" gibi unvanlar kazanıyordu. Otuz gün içinde seksen beş bin çalışan yaklaşık altmış trilyon token yaktı. Forbes, Wall Street Journal ve Fortune olayı haber yaptı ve olgunun bir adı oldu: tokenmaxxing. Düşünce şuydu: yapay zeka kullanımını en üst düzeye çıkarın, verimlilik peşinden gelir.
Birkaç hafta sonra tablo kaldırıldı. Amazon, çalışanlar sayılarını şişirmek için anlamsız ajanlar çalıştırmaya başlayınca kendi sürümünü sessizce kapattı. Mühendisler token yakmaktan başka bir işe yaramayan döngüler yazdı. Uber'in operasyon direktörü, token harcaması ile gerçek verimlilik arasındaki bağın basitçe var olmadığını itiraf etti. Michael Burry buna "liderlik tablosu güdümlü, yönetim dayatmalı aşırı tüketim" dedi.
Bu hikâyeyi okudum ve tanıdık bir şey hissettim. Yapay zeka alanında çalıştığım için değil, öğrenme alanında çalıştığım için. Öğrenme ve gelişimde vakit geçirmiş herkes size aynı şeyi söyler: biz bu hikâyenin kendi versiyonunu onlarca yıldır oynuyoruz. Silikon Vadisi sadece ona bir isim koydu.
Biz hep başka bir adla andık: tamamlama oranı.
Ölçüt olmayan ölçüt
Tanıdık bir gösterge paneli. Eğitim platformu yüzde doksan dört tamamlama gösteriyor. İki bin saat eğitim verilmiş. Katılım skorları seksenlerin üstünde. Çeyrek değerlendirmesi iyi geçiyor. Slayt tüm şirket sunumuna giriyor. Herkes yoluna devam ediyor.
Altı ay sonra işte hiçbir şey değişmemiş oluyor. Satış görüşmeleri aynı tınlıyor. Yeni yönetici eğitimi daha iyi yöneticiler üretmemiş. Uyum eğitimini herkes geçmiş ve çoğu unutmuş. Pahalı liderlik programı "oteldeki o iki gün" olarak hatırlanıyor.
Bu bir öğrenme başarısızlığı değil. Bir ölçüm başarısızlığı. Etkinliği ölçtük çünkü etkinliği ölçmek kolaydı. Sonra ölçümü, temsil etmesi gereken sonucun kendisi sandık.
Bu hatanın bir adı var. Öğrenme ve gelişimden de, yapay zekadan da, gösterge panellerinden de eski. Adı Goodhart Yasası: bir ölçüt hedefe dönüştüğü anda iyi bir ölçüt olmaktan çıkar. "Tamamlama oranı" peşinden koşulacak bir şeye dönüştüğü anda, insanların gerçekten öğrenip öğrenmediği hakkında bize bir şey söylemeyi bıraktı.
Peki neden yine de yapıyoruz
Etkinlik ölçütlerinin bizim alanımızda neden bu kadar baştan çıkarıcı olduğu konusunda dürüst olmak istiyorum. Bunlar tembelliğin ya da kötü niyetin sonucu değil. Var olmalarının sebebi, gerçek öğrenmeyi ölçmenin cidden zor olması.
Tamamlamaları bir veritabanı sorgusuyla sayabilirsiniz. Ama bir satış müdürünün atölyeden sonra zor bir koçluk konuşmasını farklı yönetip yönetmediğini temiz bir biçimde sayamazsınız. Platformda geçen süreyi çeyreklik grafiğe dökebilirsiniz. Yeni bir mühendisin kod incelemesi hakkında düşünme biçiminin yavaş yavaş yeniden kurulmasını grafiğe dökemezsiniz. Öğrenmeden en çok beklediğimiz şeyler dağınık, gecikmeli ve işte olup biten her şeye dolanmış durumda.
Bu yüzden yerine koyuyoruz. Ölçebildiğimizi ölçüyoruz. Yönetim kurulu toplantılarında ve bütçe değerlendirmelerinde kolay sayılar zor olanları kenara itiyor. Tamamlama verisi güçlü olan program ayakta kalıyor. Gerçek davranış değişikliğine dair daha dağınık kanıtı olan program kesiliyor.
Tokenmaxxing'i üreten örüntü de tam olarak bu. Mühendislik çıktısını ölçmek zor. Token tüketimini ölçmek çocuk oyuncağı. Kolay ölçüt kazandı, ta ki hedefe dönüşene kadar; sonra çalışmayı bıraktı.
Araştırmaların söylemeye devam ettiği şey
McKinsey'nin son State of AI raporu, şirketlerin yalnızca yüzde altı kadarının yapay zeka yatırımlarından gerçek finansal etki elde ettiğini buldu. Bu şirketlerin ortak özelliği daha yoğun yapay zeka kullanımı değil. İşin nasıl yapıldığını kökten yeniden tasarlamış olmaları. MIT'nin NANDA grubu ise kurumsal yapay zeka pilotlarının yüzde doksan beşinin hiçbir ölçülebilir etki üretmediğini buldu.
Öğrenme ve gelişimdeki rakamlar rahatsız edici biçimde benzer görünüyor. Kurumsal eğitimin etkililiğine dair sektör araştırmaları düzenli olarak programların yalnızca küçük bir kısmının gösterilebilir davranış değişikliği ürettiğini buluyor. Öğrenme yatırımının büyük bölümü, öğrenme yönetim sistemindeki tamamlama ekranı ile pazartesi sabahı arasında bir yerde buharlaşıyor.
Bu kanıtın dürüst okuması, öğrenmenin işe yaramadığı değil. Etkinliğe yatırım yapıp bunun bir şekilde yetkinliğe dönüşmesini umduğumuz. Tamamlamaların, saatlerin ve katılım skorlarının yönetimi etrafında koca departmanlar kurduk; oysa bunların hiçbiri hiçbir zaman asıl mesele değildi.
Farklı bir soru
Gerçekten önemli olanı ölçmek nasıl görünürdü?
Farklı bir açılış sorusuyla başlıyor. Hangi eğitimi vermeliyiz? değil, altı ay sonra, öğrenme ve gelişim dışından birinin fark edebileceği şekilde ne farklı olmalı? Yeni yöneticilerden daha az sorun yükseltme. Yeni işe alınanların daha hızlı verim vermesi. Belirli bir iş kazası oranının düşmesi. Belirli bir kararın, belirli kişiler tarafından, daha sık ve daha iyi verilmesi.
Bu yeni bir şey değil. Kirkpatrick modeli altmış yıldır buraya işaret ediyor. Veri, araçlar, hatta yöntemler onlarca yıldır elimizde. Eksik olan daha az teknik ve düzeltmesi daha zor bir şey: etrafımızdaki sistem bu işi yapmamıza aslında izin vermiyor.
Bir davranışı değiştirmek için tasarlanmış bir öğrenme müdahalesi, tamamlanmak için tasarlanmış olandan bambaşka bir nesnedir. Birincisi daha kısadır, gerçek işin içine gömülüdür, yönetici konuşmalarıyla desteklenir ve aylar içinde iş akışında neyin değiştiğiyle değerlendirilir. İkincisi bir kurstur. Çoğumuz işe yarayanın birincisi olduğunu biliyoruz. Çoğumuz onu gerçekten kuramıyoruz.
Sebepleri gizemli değil. Davranış değişikliği programları yöneticilerin sadece aday göstermesini değil koçluk yapmasını gerektirir. İş liderlerinin "daha iyi"nin somut olarak ne demek olduğunu program başlamadan önce tanımlamasını gerektirir. Finansın kanıt için daha uzun beklemesini gerektirir. Yöneticilerin, daha küçük ve daha yavaş bir müdahalenin daha büyük ve hızlı olandan fazla etki üretebileceğini kabul etmesini gerektirir. İnsan kaynakları sistemlerinin koltuk süresi ve puan dışında bir şey izleyebilmesini gerektirir.
Bunların hiçbiri öğrenme ve gelişim biriminin tek başına verebileceği bir şey değil. Doğru programı tasarlayabiliriz ama onun işe yarayacağı koşulları tek başımıza kuramayız. İş birimi üçüncü çeyreğe bir liderlik programı isterken, yöneticinin koçluk yapacak vakti yokken, bütçe değerlendirmesi on iki haftada sayı isterken ve sistem yalnızca tamamlama raporluyorken, akılcı tepki tamamlanabilir bir şey teslim etmektir. Kurslara inandığımız için değil, sistem sayılabilir olanı ödüllendirdiği için kurs kuruyoruz.
Tokenmaxxing hikâyesinin görünür kıldığı zor gerçek bu. Token sayılarını manipüle eden Meta mühendisleri aptal değildi. Kendilerine verilen bir ölçüte akılcı biçimde tepki veriyorlardı. Ölçütü kaldırın, davranış bir gecede değişir. Öğrenme ve gelişimde de aynısı geçerli. Yönetim sunumu tamamlama oranı istediği sürece, birim tamamlama oranı için optimize edecektir.
Bunu değiştirmek bir öğrenme ve gelişim projesi değil. İş liderleriyle, finansla, insan kaynaklarıyla, yöneticilerle, neyin ölçüleceğine ve neyin fonlanacağına karar verenlerle yapılması gereken bir konuşma. Birimin işi soruyu sormaya devam etmek. Sistemin işi ise onu duymaya istekli olmak.
Kaçındığımız konuşma
On beş yıldır bu işin içindeyim ve katıldığım bütçe değerlendirmelerinde bir örüntü tekrar edip duruyor. Davranış değişikliği, verime ulaşma süresi, yetkinlik inşası üzerine bir anlatıyla giriyorum. Geri gelen sorular çoğunlukla tamamlama oranları ve katılım skorlarıyla ilgili oluyor. Konuşma odadaki herkesin zihninde tutabildiği sayılara doğru kayıyor ve derin gerekçe bir dipnota sıkışıyor. Eminim bu her oda için, her seferinde geçerli değil. Ama planlamayı ve sunmayı nasıl öğrendiğimi şekillendirecek kadar çok oda, çok seferdi.
Bu ne öğrenme ve gelişim uzmanının, ne finans direktörünün, ne de insan kaynakları direktörünün başarısızlığı. Her biri kendi rolünün ödüllendirdiği şeye tepki veriyor. Uzmanın bir bütçe savunması gerekiyor. Finans direktörünün birimler arası karşılaştırılabilir ölçütlere ihtiyacı var. İnsan kaynakları direktörünün hesap verebilirliğe benzeyen bir şeye ihtiyacı var. Tamamlama oranları üçüne de kötü biçimde hizmet ediyor. Ama hizmet ediyor.
İhtiyacımız olan değişim, öğrenme ve gelişimcinin saat üçteki toplantıda daha cesur olması değil. Toplantının kendisinin değişmesi. Masadaki sorunun değişmesi. Birimin üstünde birinin şunu söylemesi: Bu çeyrek tamamlama oranı istemiyorum. Yeni yöneticilerin altı ay önce yapamadığı neyi şimdi yapabildiğini bilmek istiyorum ve gerçek bir cevap için beklemeye razıyım.
Kaçındığımız konuşma bu. Ve bu olana kadar birim, odanın istediği şey için optimize etmeye devam edecek.
Tokenmaxxing hikâyesinden aldığım
Meta ve Amazon'un liderlik tabloları, saçmalık görünür hale gelir gelmez hızla kaldırıldı. Mühendislerin token sayılarını manipüle etmesi görmezden gelinemeyecek kadar aşikârdı. Bizim tamamlama oranı panellerimizin aynı hızla kalkacağından şüpheliyim. Saçmalık fazla tanıdık, fazla yerleşik ve yanlış toplantılarda fazla işe yarıyor.
Ama altta yatan dersin taşınabilir olduğunu düşünüyorum. Daha fazla bir strateji değil. Daha fazla içerik daha fazla öğrenme üretmiyor. Saat ve tamamlama anlamında daha fazla öğrenme, daha iyi performans üretmiyor. Asıl iş, daha iyinin somut olarak ne anlama geleceğini, sözde yardım ettiğimiz insanların hayatında bulmak ve sonra onu ölçmek.
Bu daha zor. Daha yavaş. Yönetim sunumuna o kadar düzgün oturmuyor. Ayrıca öğrenme ve gelişim tarafından tek başına yapılamaz. Ne istediklerini gerçekten tanımlamaya istekli iş liderlerine, koçluk yapmaya istekli yöneticilere, beklemeye istekli finansa, farklı sorular sormaya istekli üst yönetime ihtiyacı var. Birim değişimi savunabilir. Değişimi tek başına yapamaz.
Tokenmaxxing hikâyesi solacak. Bir sonraki yapay zeka heyecan döngüsü çoktan başlıyor. Ama gündeme getirdiği soru, etkinliği önemli olduğu için mi yoksa kolay olduğu için mi ölçüyoruz?, her kurumdaki her birimin er ya da geç cevaplaması gereken bir soru.
Belki de artık bunu birlikte sorma vakti.
İlkem Kayıcan Dipçin, yapay zeka destekli bir öğrenme tasarımı projesi olan inspaire'in yürütücüsüdür ve on beş yıldır yükseköğretim ile kurumsal ortamlarda öğrenme programları tasarlamaktadır. Burası "Learning That Feels Good"; öğrenmeyi gerçekten işe yaratan şeyler üzerine bir bülten: arkasındaki bilim, tasarım ve insani deneyim.
Bu yazı sizde bir karşılık bulduysa, yatırım getirisini kanıtlamakla bu işe neden başladığını hatırlamak arasında sıkışmış birine gönderin.
