needhelp
← Back to blog

जब 1967 का फ़ॉर्मूला आधुनिक AI की सबसे बड़ी समस्या हल करता है

by needhelp
AI Research
Reinforcement Learning
Mathematics
Scientific Discovery

Sutton का सुरुचिपूर्ण फ़िक्स

रीइन्फ़ोर्समेंट लर्निंग का एक गंदा सीक्रेट है: स्ट्रीमिंग एनवायरनमेंट में मॉडल ट्रेन करना फ़ंडामेंटली ब्रोकन है। जो एल्गोरिदम लैब में खूबसूरती से काम करते हैं, वे रियल वर्ल्ड में डिप्लॉय होने पर फेल हो जाते हैं जहाँ डेटा लगातार आता है और डिस्ट्रीब्यूशन शिफ़्ट होते हैं।

Richard Sutton, रीइन्फ़ोर्समेंट लर्निंक के गॉडफ़ादर, ने इसे ठीक कर दिया। और उनका समाधान लगभग शर्मनाक रूप से सुरुचिपूर्ण है: 1967 का एक फ़ॉर्मूला।

“Intent Update Algorithm” मॉडल के आउटपुट को हर नए डेटा के साथ शिफ़्ट होने की मात्रा को कंस्ट्रेन करता है। बीच-बीच में विरोधाभासी सिग्नलों के बीच झूलने के बजाय, मॉडल जानबूझकर चलता है।

नतीजा? कंप्यूटेशन मेनस्ट्रीम एल्गोरिदम के 1/140वें हिस्से पर आ जाता है।

यह क्यों मायने रखता है

Sutton की सफलता एज-डिवाइस रीइन्फ़ोर्समेंट लर्निंग का दरवाज़ा खोलती है। रोबोट जो सर्वर फ़ार्म से कनेक्ट हुए बिना लगातार सीखते हैं। ड्रोन जो रियल टाइम में हवा के पैटर्न के हिसाब से ढल जाते हैं।

वह गणित रिकॉर्ड जिसने Google को चौंका दिया

जहाँ Sutton RL फ़िक्स कर रहे थे, Wang Yiping — Zhejiang University के पूर्व छात्र — सेल्फ़-बिल्ट AI टूल्स का उपयोग करके वह कर रहे थे जो Google की रिसर्च टीम नहीं कर सकी: Ramsey नंबर लोअर बाउंड को तोड़ना, एक समस्या जो 30 सालों से अनसुलझी थी।

नई वैज्ञानिक विधि

ये दोनों कहानियाँ एक सामान्य सूत्र साझा करती हैं: AI अब सिर्फ़ प्रोडक्ट बनाने का टूल नहीं है। यह एक वैज्ञानिक उपकरण बन रहा है — माइक्रोस्कोप या टेलिस्कोप जितना ही बुनियादी।

Share this page