needhelp
← Back to blog

غواصی عمیق در تحقیقات مرزی هوش مصنوعی ۲۰۲۶: از شبیه‌سازی هزاران کارت تا مدل‌های جهان

by needhelp
AI Research
PrismLLM
PhysBrain
Elastic DiT
IVGT

تاریخ: ۲۰۲۶-۰۵-۱۹ | منبع: AI News Daily | زمان مطالعه: ~۱۵ دقیقه

AI Research Banner


۱. PrismLLM: شبیه‌سازی یک کلاستر ۱۰K-GPU با چند کارت

۱.۱ زمینه تحقیق و مسئله

آموزش مدل‌های زبانی بزرگ (LLM) به ده‌ها هزار GPU/TPU نیاز دارد که هماهنگ کار کنند—یک زیرساخت عظیم با هزینه‌های ساخت و عملیاتی گزاف. برای بیشتر مؤسسات تحقیقاتی و شرکت‌های کوچک-متوسط، «کمبود کارت» بزرگترین تنگنا در تحقیقات آموزش مدل‌های بزرگ است.

چارچوب PrismLLM یک فناوری شبیه‌سازی با وفاداری بالا ارائه می‌دهد که هدف اصلی آن را می‌توان با مسئله بهینه‌سازی زیر توصیف کرد:

minθL(fsim(x;θ),freal(x))+λΩ(θ)\min_{\theta} \mathcal{L}\left( f_{\text{sim}}(x; \theta), f_{\text{real}}(x) \right) + \lambda \cdot \Omega(\theta)

که fsimf_{\text{sim}} مدل شبیه‌سازی، frealf_{\text{real}} رفتار یک کلاستر واقعی ۱۰K-GPU و Ω(θ)\Omega(\theta) عبارت منظم‌سازی است.

۱.۲ اصول فنی اصلی

نوآوری اصلی PrismLLM توانایی شبیه‌سازی رفتار آموزشی یک کلاستر عظیم با تنها چند GPU است، با خطای بسیار کم (زیر ۱٪).

کلاستر واقعی ۱۰K-GPUماژول جمع‌آوری رفتارتحلیل الگوی ارتباطمدل‌سازی ویژگی محاسباتردیابی دسترسی حافظهموتور شبیه‌سازی باوفاداری بالاسخت‌افزار مقیاس کوچکپیش‌بینی رفتار آموزشیبهینه‌سازی فراپارامترپیش‌بینی خطاتخمین هزینه

۱.۳ ویژگی‌های فنی کلیدی

ویژگی توضیحات مزیت
خطای شبیه‌سازی < ۱٪ انحراف از نتایج آموزش کلاستر واقعی ۱۰K-GPU در ۱٪ نگه داشته می‌شود دقت پیش‌بینی بسیار بالا
شبیه‌سازی توپولوژی ارتباط الگوهای ارتباط جمعی مثل all-reduce، all-gather را دقیقاً شبیه‌سازی می‌کند بدون نیاز به محیط شبکه واقعی
استراتژی موازی ترکیبی شبیه‌سازی ترکیبی از داده‌موازی، مدل‌موازی و خط‌لوله‌موازی را پشتیبانی می‌کند پوشش طرح‌های آموزشی主流
مدل‌سازی بار پویا عوامل پویا مثل نوسان استفاده GPU، فشار حافظه را در نظر می‌گیرد نزدیک‌تر به سناریوهای واقعی

۱.۴ سناریوهای کاربرد

کاهش هزینه تحقیقاتی=CrealCsimCreal×100%95%\text{کاهش هزینه تحقیقاتی} = \frac{C_{\text{real}} - C_{\text{sim}}}{C_{\text{real}}} \times 100% \approx 95%

  • جستجوی فراپارامتر: پیش‌غربال‌گری پیکربندی‌های بهینه روی سخت‌افزار مقیاس کوچک
  • پیش‌بینی خطا: شناسایی زودهنگام مشکلات بالقوه در آموزش توزیع‌شده
  • تخمین هزینه: برآورد دقیق نیازمندی‌های منابع برای مقیاس‌های مختلف آموزش

۲. PhysBrain: یادگیری فیزیک از ویدئو

۲.۱ مفهوم اصلی

PhysBrain یک مدل پایه عقل سلیم فیزیکی است که قوانین جهان فیزیکی (مثل گرانش، برخورد، اصطکاک و…) را با تماشای ویدئو یاد می‌گیرد و به این ترتیب قابلیت‌های کنترل ربات را به طور قابل توجهی بهبود می‌بخشد.

a^t=argmaxaP(ast,Kphysics)\hat{a}t = \arg\max_a P(a | s_t, \mathcal{K}{\text{physics}})

که Kphysics\mathcal{K}_{\text{physics}} پایگاه دانش عقل سلیم فیزیکی است که مدل از ویدئو یاد گرفته.

۲.۲ معماری مدل

هسته PhysBrainخروجیورودی ویدئوپیش‌بین دینامیکرمزگذار بصریقوانین فیزیکیویژگی‌های اشیاءاستراتژی کنترلماژول استدلال فیزیکیاجرای رباتدنباله فریم‌های ویدئو

۲.۳ ماتریس قابلیت‌های کلیدی

قابلیت=[ادراک گرانشپیش‌بینی برخوردمدل‌سازی اصطکاکدینامیک سیالاتحرکت جسم صلبویژگی موادروابط علّیانتقال وضعیتتعامل با محیط]\mathbf{قابلیت} = \begin{bmatrix} \text{ادراک گرانش} & \text{پیش‌بینی برخورد} & \text{مدل‌سازی اصطکاک} \ \text{دینامیک سیالات} & \text{حرکت جسم صلب} & \text{ویژگی مواد} \ \text{روابط علّی} & \text{انتقال وضعیت} & \text{تعامل با محیط} \end{bmatrix}

۲.۴ عملکرد در معیارهای هوش تجسم‌یافته

25%20%18%15%12%10%گرفتن اشیاءعملیات کشیدن و هل دادنپیش‌بینی پرتابپایداری روی هم چیدناستفاده از ابزارناوبری و مانع‌یابیحوزه‌های قهرمانی PhysBrain در تست هوش تجسم‌یافته

محیط‌های تست:

پلتفرم نوع وظیفه رتبه PhysBrain
SAPIEN دستکاری اشیاء مفصلی
MuJoCo کنترل پیوسته
Habitat ناوبری بصری
Isaac Sim مونتاژ صنعتی

Robotics Vision


۳. Elastic DiT: پیشرفت جدید در تولید تصویر real-time روی موبایل

۳.۱ تعریف مسئله

مدل‌های Diffusion سنتی (مثل Flux، Stable Diffusion) با یک trade-off شدید کیفیت در مقابل تأخیر روی دستگاه‌های موبایل مواجه‌اند:

کیفیت1تأخیر×محاسبات\text{کیفیت} \propto \frac{1}{\text{تأخیر} \times \text{محاسبات}}

Elastic DiT (Elastic Diffusion Transformer) این محدودیت را از طریق تنظیم پویای پارامتر می‌شکند.

۳.۲ مکانیزم زمان‌بندی پویای پارامتر

زمان‌بند الاستیکلایه ورودیهسته DiTتوجه تنکپیکربندی A: حالتفوق‌سریعتأخیر < 50msپیکربندی B: حالت متعادلتأخیر 200-500msپیکربندی C: حالت کیفیتتأخیر 1-2sاطلاعات دستگاهعمق پویاعرض پویاتصویر تولیدشدهترجیح کیفیتزمان‌بند الاستیکدرخواست کاربر

۳.۳ فرمول‌بندی ریاضی

عبور رو به جلوی Elastic DiT به صورت زیر بیان می‌شود:

xt1=αtxt+σtE(xt,t,c;θ(d,w))\mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \cdot \mathcal{E}(\mathbf{x}_t, t, c; \theta(d, w))

که پارامترهای زمان‌بندی (d,w)(d, w) به صورت پویا توسط شرایط دستگاه و نیازمندی‌های کیفیت تعیین می‌شوند:

(d,w)=argmind,wL(θ(d,w))+μT(d,w,device)(d^, w^) = \arg\min_{d,w} \mathcal{L}(\theta(d,w)) + \mu \cdot T(d,w, \text{device})

۳.۴ مقایسه عملکرد

مدل دستگاه تأخیر FID وضوح
Flux-dev RTX 4090 ۲.۱s ۵.۲ ۱۰۲۴x۱۰۲۴
SDXL RTX 4090 ۳.۵s ۶.۱ ۱۰۲۴x۱۰۲۴
Elastic DiT (سرعت) iPhone 16 < ۵۰ms ۶.۸ ۵۱۲x۵۱۲
Elastic DiT (متعادل) iPhone 16 ۳۰۰ms ۵.۰ ۱۰۲۴x۱۰۲۴
Elastic DiT (کیفیت) iPhone 16 ۱.۲s ۴.۳ ۱۰۲۴x۱۰۲۴

حالت سرعت به کیفیت تصویر فراتر از مدل‌های Flux روی موبایل می‌رسد!

Mobile AI


۴. IVGT: چارچوب بازسازی سه‌بعدی ضمنی

۴.۱ نمای کلی فنی

IVGT (Implicit Volume Geometry Transformer) یک چارچوب نوآورانه بازسازی سه‌بعدی ضمنی است که می‌تواند به طور خودکار هندسه سه‌بعدی پیوسته را از تصاویر معمولی ۲D بسازد و به رندرینگ با دقت بالا دست یابد.

۴.۲ خط لوله فنی

تصویرچندنمایی/تک‌تصویرینقشه ویژگیعمیقNeRF/میدان SDFضمنیبهینه‌سازیرندر حجمیاستخراجMarching Cubesمش مثلثی +متریال PBRمدل سه‌بعدیتعاملیرمزگذار تصویراستخراج ویژگیساخت میدانضمنیتولید مشخروجی رندرورودی کاربرورودی کاربررمزگذار تصویراستخراج ویژگیساخت میدانضمنیتولید مشخروجی رندر

۴.۳ نمایش ضمنی

IVGT از یک تابع فاصله علامت‌دار ضمنی (SDF) برای نمایش هندسه سه‌بعدی استفاده می‌کند:

f(x;θ):R3Rf(\mathbf{x}; \theta): \mathbb{R}^3 \rightarrow \mathbb{R}

که:

  • f(x)=0f(\mathbf{x}) = 0 سطح جسم را نشان می‌دهد
  • f(x)>0f(\mathbf{x}) > 0 خارج از جسم را نشان می‌دهد
  • f(x)<0f(\mathbf{x}) < 0 داخل جسم را نشان می‌دهد

میدان ضمنی از طریق معادله رندر حجمی به تصویر تبدیل می‌شود:

C^(r)=tntfT(t)σ(r(t))c(r(t),d)dt\hat{C}(\mathbf{r}) = \int_{t_n}^{t_f} T(t) \cdot \sigma(\mathbf{r}(t)) \cdot \mathbf{c}(\mathbf{r}(t), \mathbf{d}) , dt

که transmittance:

T(t)=exp(tntσ(r(s))ds)T(t) = \exp\left( -\int_{t_n}^{t} \sigma(\mathbf{r}(s)) , ds \right)

۴.۴ عملکرد در وظایف بازسازی مش

روش Chamfer-L1 ↓ F-Score ↑ زمان آموزش نیازمندی ورودی
NeRF ۰.۰۸۵ ۰.۷۲ ۱۲h چندنمایی
NeuS ۰.۰۶۲ ۰.۸۱ ۸h چندنمایی
VolSDF ۰.۰۵۸ ۰.۸۴ ۱۰h چندنمایی
IVGT ۰.۰۳۱ ۰.۹۳ ۲h تک/چندنمایی

۵. مقایسه جامع و چشم‌انداز آینده

۵.۱ نمای کلی مقایسه چهار فناوری

لایه کاربردیلایه تحقیقاتیهدف مشترکElastic DiTتولید تصویر موبایلفناوری هوش مصنوعیهمگانیکاهش门槛 هوش مصنوعیIVGTبازسازی سه‌بعدیPrismLLMشبیه‌سازی آموزشPhysBrainدرک فیزیک

۵.۲ تحلیل کمی روندها

روند热度 تحقیقاتفناوری هوش مصنوعی(۲۰۲۴-۲۰۲۶)0100200300400500۲۰۲۴ Q1۲۰۲۴ Q3۲۰۲۵ Q1۲۰۲۵ Q3۲۰۲۶ Q1۲۰۲۶ Q2تعداد مقالات (تخمینی)

۵.۳ خلاصه فرمول‌های کلیدی

تکنیک فرمول اصلی هدف
PrismLLM minL(fsim,freal)+λΩ\min \mathcal{L}(f_{\text{sim}}, f_{\text{real}}) + \lambda\Omega شبیه‌سازی رفتار آموزش
PhysBrain a^t=argmaxP(ast,K)\hat{a}_t = \arg\max P(a | s_t, \mathcal{K}) تصمیم‌گیری آگاه از فیزیک
Elastic DiT xt1=αtxt+σtE(;θ(d,w))\mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \mathcal{E}(\cdot; \theta(d,w)) استنتاج پویا
IVGT C^(r)=T(t)σ(r(t))c()dt\hat{C}(\mathbf{r}) = \int T(t)\sigma(\mathbf{r}(t))\mathbf{c}(\cdot)\,dt رندر حجمی

۵.۴ چشم‌انداز آینده

PrismLLM هزینه تحقیق آموزش مدل‌های بزرگ را ۹۵٪ یا بیشتر کاهش می‌دهد و academia را قادر به مشارکت در تحقیقات مدل‌های پیشرفته می‌کند.

PhysBrain راه را برای ربات‌های همه‌منظوره هموار می‌کند—ربات‌های خانگی واقعاً «بامعرفت» ظرف ۳-۵ سال انتظار می‌روند.

Elastic DiT نشان‌دهنده رسیدن تولید تصویر هوش مصنوعی عملی روی موبایل است—ایجاد real-time با هوش مصنوعی روی گوشی به استاندارد تبدیل می‌شود.

قابلیت بازسازی سه‌بعدی تک‌تصویری IVGT workflowهای توسعه بازی و AR/VR را متحول خواهد کرد.


References

مقالات

منابع ویدئویی

پروژه‌های متن‌باز


این سند توسط AI News Daily در ۲۰۲۶/۵/۱۹ گردآوری شده و به طور مداوم تحولات تحقیقات مرزی هوش مصنوعی را دنبال می‌کند.

Share this page