LLM RL'de Eğitim-Çıkarım Uyumsuzluğunu Skor Merkezileme ile Düzeltme
1. Abstract & Executive Summary
Eğitim-çıkarım uyumsuzluğu (TIM), pekiştirmeli öğrenmedeki istikrarsızlığın ana kaynağıdır; bu sapma, her adımda modeli örnekleyiciye doğru distilasyon eden 'drift' terimini üretir Score Centering Stabilizes Off-policy Reinforcement Learning. TIM'i tamamen gidermek rollout verimliliğini düşürdüğü için pratik değildir; yöntem, uyumsuzluğu yok etmek yerine stabiliteyi hedefler Score Centering Stabilizes Off-policy Reinforcement Learning. Skor merkezileme, drifti sıfırlayan additif bir düzeltmedir; örnekleyicinin top-k log-olasılıklarını (varsayılan k=128) depolar ve kuyruğu eğitimcinin dağılımıyla modeller Score Centering Official Repository. Yazar ölçümlerine göre 0.6B-30B parametreli Qwen3 modellerinde, kuantizasyon altındaki önem örneklemesiyle eşdeğer veya daha iyi performans gösterir; fark uyumsuzluk arttıkça büyür Score Centering Stabilizes Off-policy Reinforcement Learning. Düzeltme, önem örneklemesiyle birleştirilebilir ve bu kompozisyon saf baz çizgilerinden üstündür Score Centering Stabilizes Off-policy Reinforcement Learning. Sonuçlar spesifik model ölçekleri ve görev dağılımlarıyla sınırlıdır; evrensel bir üstünlük iddiası taşımaz Score Centering Stabilizes Off-policy Reinforcement Learning.
2. Tarihsel Arka Plan ve Problem Tanımı
Pekiştirmeli öğrenmede (RL) büyük dil modeli eğitimi, eğitim motoru ile çıkarım (sampler) motoru arasındaki yapısal farklılıklardan kaçınmak zorundadır. Bu durum, eğitim-çıkarım uyuşmazlığı olarak bilinen TIM'i yaratır. TIM'in tamamen ortadan kaldırılması, örneğin her adımda ağırlıkların senkronize edilmesi veya batch-invariant kernel kullanımı gibi yöntemlerle mümkündür; ancak bu yaklaşımlar rollout verimliliği üzerinde ciddi bir performans düşüşüne neden olur Score Centering Stabilizes Off-policy Reinforcement Learning. Pratik sistemlerde, çıkarım motorunun kuantizasyonu (FP8, INT4 vb.) veya KV-cache yönetimi gibi optimizasyonlar, eğitim motorundaki tam hassasiyetli hesaplama ile arasında kalıcı bir dağıtım farkı bırakır. Bu fark, tek seferlik bir gürültü değil, her eğitim adımında biriken sistematik bir sapmadır.
Sorunun kök nedeni, bu uyumsuzluğun politik gradyan kaybına nasıl yansıdığıdır. TIM varlığında, standart politika gradyanı beklenen ödülle ölçeklenmiş bir çapraz entropi (SFT) kaybı gradyanını içerir; bu terim, modelin her önekinde örnekleyici dağılımına doğru distilasyonuna yol açar Score Centering Stabilizes Off-policy Reinforcement Learning. Bu 'drift' terimi, RL'nin ödül sinyaliyle öğrenme kapasitesini baltalar ve istikrarsızlığa neden olur. Skor merkezileme yaklaşımı, TIM'i yok etmek yerine bu drift teriminin etkisini matematiksel olarak iptal ederek stabiliteyi sağlamayı hedefler Score Centering Stabilizes Off-policy Reinforcement Learning. Bu ayrım kritik öneme sahiptir: yöntem, motorları eşleştirmek yerine, uyumsuzluğun neden olduğu yan etkiyi telafi eder. Böylece, rollout verimliliğinden ödün vermeden, eğitim sürecinin öngörülebilirliğini korumak mümkün hale gelir.
3. Matematiksel ve Teorik Temeller
TIM kaynaklı istikrarsızlığın kökeni, politika gradyanındaki drift terimidir. Bu terim, örnekleyici dağılımı $q$ ile eğitimci dağılımı $p$ arasındaki farktan doğar ve matematiksel olarak, örnekleyiciye doğru çapraz entropi (SFT) kaybının beklenen gradyanına karşılık gelir Score Centering Stabilizes Off-policy Reinforcement Learning. Bu durum, her eğitim adımında modelin örnekleyiciye doğru sürekli bir distilasyonuna neden olur; süreç, pozitif geri bildirim döngüsüyle bileşik hale gelerek eğitimi istikrarsızlaştırır.
Skor merkezileme, bu drift terimini sıfırlayan additif bir düzeltmedir. Düzeltme, ödül ile token skorları arasındaki kovaryansı ($Cov_q(R, s_{y_t})$) kullanarak hesaplanır ve kayıp fonksiyonuna doğrudan eklenir Score Centering Stabilizes Off-policy Reinforcement Learning. Bu mekanizma, örnekleyici dağılımının yarattığı sistematik önyargıyı iptal ederek RL güncellemesinin TIM varlığında stabil kalmasını sağlar.
Uygulamada, yöntem örnekleyicinin top-k log-olabilirliklerini ($k=128$ varsayılan) depolar ve kuyruk dağılımını eğitimci modeliyle ölçeklendirir Score Centering Official Repository. Bu, motorlar arasında ek veri aktarımı gerektirse de TIM'i tamamen ortadan kaldırmaya kıyasla rollout verimliliği korunur. Düzeltmenin additif doğası, onu önem örnekleme ile birleştirmeye olanak tanır; yazar ölçümlerine göre bu kompozisyon, kuantizasyon ve staleness senaryolarında saf önem örneklemesi baz çizgilerinden daha iyi performans gösterir Score Centering Stabilizes Off-policy Reinforcement Learning.
4. Sistem Mimarisi ve Veri Akışı
Sistem mimarisi, eğitimci (trainer) ile örnekleyiciyi (sampler) fiziksel olarak ayırır. Bu ayrım, asenkron veri üretimi ve GPU verimliliği için gereklidir; ancak iki motorun farklı donanım optimizasyonları veya ağırlık kuantizasyonu kullanması durumunda TIM ortaya çıkar Score Centering Stabilizes Off-policy Reinforcement Learning. Veri akışında kritik olan, örnekleyicinin ürettiği token dizilerinin yanı sıra, her adım için top-k log-olasılıklarının (varsayılan k=128) eğitimciye aktarılmasıdır Score Centering Official Repository. Bu ek veri yükü, düzeltme teriminin hesaplanabilmesi için zorunludur; ancak k=32 gibi daha küçük değerlerin de tam merkezileme ile eşdeğer performans gösterdiği raporlanmıştır Score Centering Official Repository.
Eğitim döngüsünde, skor merkezileme düzeltmesi kayıp fonksiyonuna additif olarak eklenir. Kod tabanında score_center parametresi, RL kaybı hesaplanırken doğrudan gradyan girdisine dahil edilir train_rl.py Implementation. Bu yapı, yöntemin önem örnekleme (importance sampling) teknikleriyle bağımsız veya kompozit olarak kullanılmasına olanak tanır; örneğin TIS veya MIS ağırlıkları ile birlikte uygulanabilir train_rl.py Implementation. Örnekleyici tarafında, TIM'i simüle etmek için sentetik ağırlık gürültüsü, INT8/FP8 kuantizasyonu veya KV-cache kısıtları yapılandırılabilir train_rl.py Implementation. Bu mimari esneklik, yöntemin farklı mühendislik senaryolarında test edilmesine imkân verir.
[Sampler (FP8/INT4)] --(Tokens + Top-k Logprobs)--> [Data Buffer]
| |
| (Ağırlık Snapshot / Staleness) v
| [Trainer (FP32/BF16)]
| |
| +-------------------+
| | RL Loss Function |
| | - Policy Gradient |
| | - Score Centering |
| | - IS Weights (opt)|
| +-------------------+
| |
v v
[Inference Engine] [Optimizer Update]
5. Uygulama ve Referans Kod
Skor merkezileme düzeltmesi, mevcut RL eğitim döngülerine additif bir terim olarak entegre edilir. Resmî depodaki JAX tabanlı train_rl.py betiğinde, score_center bayrağı doğrudan RL kaybı fonksiyonuna geçirilerek mekanizma gradyan hesabına dahil edilir Score Centering train_rl.py. Bu yapı, yöntemin standart politika gradyan güncellemelerine bağımsız bir düzeltme olarak eklenebildiğini gösterir. Düzeltme, weight_fn parametresi üzerinden TIS veya MIS gibi önem örneklemesi (importance sampling) stratejileriyle birlikte kullanılabilecek şekilde tasarlanmıştır; bu kompozisyon yeteneği, yöntemin evrensel bir üstünlük iddiası taşımak yerine mevcut stabilizasyon teknikleriyle uyumlu çalıştığını vurgular Score Centering Stabilizes Off-policy Reinforcement Learning.
Uygulama tarafında, örnekleyici yapılandırması TIM'i simüle etmek veya gerçekleştirmek için esnek parametrelere sahiptir. Ağırlık kuantizasyonu (int8, fp8 vb.), KV-cache kuantizasyonu ve sentetik ağırlık gürültüsü gibi ayarlar, çıkarım motorunun eğitimden sapmasını kontrollü biçimde yönetmeyi sağlar Score Centering train_rl.py. Mimari olarak, örnekleyici ağırlıkları belirli bir refresh_period ile eğitimci ağırlıklarından anlık görüntü alınarak güncellenir; bu ayrık mimari, veri tazelik (staleness) sorunlarının doğduğu asenkron senaryoları modellemeye olanak tanır. Yazarların raporladığı deneylerde, k=128 ve k=32 top-k değerlerinin tam skor merkezileme ile eşdeğer performans gösterdiği gözlemlenmiştir Score Centering Official Repository. Bu bulgu, veri aktarım maliyetini düşürme potansiyeli sunan mühendislik bir çıkarımdır; ancak bant genişliği tasarrufu doğrudan ölçülen bir metrik değildir. Aşağıdaki sözde kod, düzeltmenin aktif olduğu basit bir kayıp hesaplama akışını özetler:
function compute_rl_loss(trainer_logits, sampler_topk_logprobs, rewards):
# Drift terimini hesapla ve iptal et
score_center_correction = calculate_covariance(rewards, token_scores)
# Önem örneklemesi ağırlıkları (isteğe bağlı)
is_weights = compute_importance_ratio(trainer_logits, sampler_topk_logprobs)
base_loss = policy_gradient_loss(rewards, trainer_logits)
final_loss = base_loss + score_center_correction
if is_weights is not null:
final_loss = apply_weighting(final_loss, is_weights)
return final_loss
Bu uygulama yaklaşımı, TIM'i tamamen ortadan kaldırmak yerine stabiliteyi koruma hedefini destekler ve mevcut RL altyapılarına düşük entegrasyon maliyetiyle uygulanabilir.
6. Empirik Analiz ve Benchmark Karşılaştırmaları
Yazarlar, yöntemin etkinliğini Qwen3-0.6B (Countdown) ve Qwen3-30B-A3B-Base (INTELLECT-2 math) modelleri üzerinde test etmiştir Score Centering Stabilizes Off-policy Reinforcement Learning. Deneyler, TIM'i simüle etmek için ağırlık kuantizasyonu ve yapay gürültü gibi koşulları içerir. Yazar ölçümüne göre, skor merkezileme tek başına kullanıldığında kuantizasyon altındaki önem örneklemesi yöntemleriyle eşdeğer veya daha iyi performans gösterir; uyumsuzluk şiddetlendikçe bu farkın arttığı gözlemlenmiştir Score Centering Stabilizes Off-policy Reinforcement Learning. Düzeltmenin additif yapısı sayesinde önem örneklemesi ile birleştirildiğinde, saf önem örneklemesi baz çizgilerinden daha yüksek stabilite sağladığı raporlanmıştır Score Centering Stabilizes Off-policy Reinforcement Learning.
| Yöntem | Model Ölçeği | Görev | TIM Koşulu | Performans |
|---|---|---|---|---|
| Skor Merkezileme (SC) | 0.6B / 30B | Countdown / Math | Kuantizasyon | Önem örneklemesi ile eşdeğer veya üstün Kaynak |
| SC + Önem Örneklemesi | 0.6B / 30B | Math | Staleness | Saf IS'den daha iyi Kaynak |
| Top-k = 32 / 128 | Raporlanmadı | Raporlanmadı | Raporlanmadı | Tam SC ile eşdeğer Kaynak |
Resmî depoda, örnekleyicinin top-k log-olasılıklarının (varsayılan k=128) depolandığı ve kuyruğun eğitimcinin dağılımıyla modellendiği belirtilmiştir Score Centering Official Repository. Yazarlar, k=32 değerinin de tam merkezileme ile eşdeğer performans gösterdiğini raporlamıştır Score Centering Official Repository. Mühendislik çıkarımı olarak, bu esneklik sistemler arası veri aktarım maliyetini yönetilebilir kılar; ancak kaynak metin bant genişliği tasarrufuna dair doğrudan bir ölçüm sunmaz. Bulgular yalnızca belirtilen model ölçekleri ve görev dağılımları için geçerlidir; daha büyük modellerde performansın korunup korunmadığı raporlanmamıştır Score Centering Stabilizes Off-policy Reinforcement Learning. Skor merkezileme, TIM'i yok etmek yerine stabiliteyi sağlamayı hedefleyen bir telafi mekanizmasıdır Score Centering Stabilizes Off-policy Reinforcement Learning.
7. Kısıtlamalar, Çıkmazlar ve Mühendislik Ödünleşimleri
Skor merkezileme, TIM'i tamamen ortadan kaldırmayı hedeflemediğinden, mühendislik ödünleşimleri kaçınılmazdır. En somut maliyet, örnekleyici ile eğitimci arasındaki ek veri aktarımıdır; düzeltme teriminin hesaplanması için örnekleyicinin top-k log-olasılıklarının (varsayılan k=128) depolanması ve eğitimciye gönderilmesi gerekir Score Centering Official Repository. Bu durum, sistem bant genişliği tüketimi ve bellek basıncı yaratır. Yazarlar, k=32 gibi daha küçük değerlerin de tam merkezileme ile eşdeğer performans gösterdiğini raporlayarak bu veri aktarım maliyetinin sınırlanabileceğini göstermiştir Score Centering Official Repository.
Yöntemin genel geçerliliği, mevcut kanıtların kapsamıyla sınırlıdır. Deneyler yalnızca Qwen3-0.6B (Countdown) ve Qwen3-30B-A3B-Base (INTELLECT-2 matematik) modellerinde yürütülmüş olup, farklı model aileleri veya görev dağılımlarına dair bağımsız doğrulama bulunmamaktadır Score Centering Stabilizes Off-policy Reinforcement Learning. Ayrıca, skor merkezilemenin önem örneklemesi ile birleştirilmesi (kompozisyon), belirli esneklik/staleness senaryolarında saf önem örneklemesinden üstün performans gösterse de, evrensel bir üstünlük iddiası taşımaz; sonuçlar koşula bağlıdır Score Centering Stabilizes Off-policy Reinforcement Learning. Sonuç olarak, yöntem TIM'in yarattığı istikrarsızlığı stabilize etmek için pratik bir düzeltme sunar; ancak rollout verimliliği ile stabilite arasındaki dengeyi korumak, sistem spesifik parametrelerin (k değeri, kuantizasyon seviyesi) dikkatli ayarlanmasını gerektirir.
8. Gelecek Projeksiyonu ve Açık Sorunlar
Skor merkezileme yönteminin mevcut kanıt tabanı, Qwen3 ailesinin 0.6B ve 30B-A3B ölçekli modelleri ile sınırlıdır; bu nedenle daha büyük parametre sayılarına veya farklı mimarilere genelleme yapılamaz Score Centering Stabilizes Off-policy Reinforcement Learning. Deneyler, Countdown ve INTELLECT-2 gibi spesifik görev dağılımlarında yürütülmüş olup, genel dil modelleme performansına dair bağımsız bir doğrulama sunulmamaktadır. Bu kapsam darlığı, yöntemin evrensel bir stabilizasyon çözümü olarak kabul edilmesini engeller; yalnızca test edilen TIM senaryoları için geçerli bir mühendislik düzeltmesi olarak konumlandırılmalıdır.
Açık kalan en kritik soru, top-k log-olasılık aktarımının büyük ölçekli dağıtık sistemlerdeki bant genişliği maliyetidir. K=128 varsayılan değeri, örnekleyici ile eğitimci arasındaki veri trafiğini artırır; k=32'nin eşdeğer performans göstermesi bu yükü azaltmakla birlikte, aşırı kuantizasyon veya yüksek staleness koşullarında yeterli olup olmadığı raporlanmamıştır Score Centering Official Repository. Ayrıca, düzeltmenin önem örneklemesi ile kompozisyonunda elde edilen kazanımların, farklı optimizasyon dinamiklerinde (örn. PPO vs GRPO) nasıl değiştiği net değildir.
Gelecek çalışmalar için üç temel yön öne çıkmaktadır: Birincisi, çok uzun bağlam pencerelerinde ve asenkron veri üretim oranları yüksek sistemlerdeki davranışın incelenmesidir. İkincisi, kuyruk dağılımının modelleme hassasiyetinin, eğitimci dağılımından sapma arttıkça nasıl degrade olduğu ve bunun için adaptif k seçim mekanizmalarının geliştirilmesidir. Son olarak, yöntemin mevcut RLHF/HF pipeline'larındaki entegrasyon derinliği ve farklı çıkarım motorları arasındaki spesifik TIM profillerine karşı performansı, bağımsız ölçümlerle test edilmelidir. Bu boşluklar doldurulmadan, skor merkezilemenin üretim ortamlarındaki standart bir bileşen olarak benimsenmesi erken olacaktır.
9. Referanslar ve İleri Okuma
-
Score Centering Stabilizes Off-policy Reinforcement Learning — Bu makale, Büyük Dil Modellerinin (LLM) pekiştirmeli öğrenmedeki kırılganlığının eğitim ve çıkarım motorları arasındaki kalıcı sapma (drift) kaynaklı olduğunu gösterir. Sapmayı ortadan kaldırmak için 'skor merkezileme' (score centering) düzeltme terimini önerir ve bu yöntemin, tamamen eşleşen motorlar gerektirmeyen bir yaklaşım olarak RL stabilitesini sağladığını iddia eder. Tarih: 2026; sürüm: v1.
-
Score Centering Stabilizes Off-policy Reinforcement Learning (Official Repository) — The official repository and implementation for the 'Score Centering' method, which proposes a correction term to stabilize off-policy RL under training-inference mismatch (TIM) by canceling drift. It includes JAX and PyTorch loss implementations, configuration sweeps for quantization/staleness, and integration with importance sampling. Tarih: 2026; sürüm: bilinmiyor.
-
train_rl.py from martin-marek/score-centering — Implementation of an RL training loop using JAX that explicitly supports a 'score centering' (sc) correction term and various importance sampling (IS) strategies to handle drift between the trainer and sampler engines. Tarih: bilinmiyor; sürüm: main.
Hiç yorum yok :
Yorum Gönder