needhelp
← Back to blog

Analisis Mendalam Riset AI Frontier: Dari Simulasi Ribuan GPU hingga Model Dunia

by needhelp
AI Research
PrismLLM
PhysBrain
Elastic DiT
IVGT

Tanggal: 2026-05-19 | Sumber: AI News Daily | Waktu baca: ~15 mnt

AI Research Banner


1. PrismLLM: Mensimulasikan Klaster 10K GPU dengan Beberapa Kartu

1.1 Latar Belakang Riset dan Masalah

Pelatihan model bahasa besar (LLM) membutuhkan puluhan ribu GPU/TPU yang bekerja secara terkoordinasi — infrastruktur masif dengan biaya konstruksi dan operasional yang sangat besar. Bagi sebagian besar institusi riset dan UKM, “kekurangan kartu” adalah hambatan terbesar dalam riset model besar.

Kerangka kerja PrismLLM mengusulkan teknologi simulasi fidelitas tinggi, yang tujuan utamanya dapat dijelaskan oleh masalah optimasi di bawah ini:

minθL(fsim(x;θ),freal(x))+λΩ(θ)\min_{\theta} \mathcal{L}\left( f_{\text{sim}}(x; \theta), f_{\text{real}}(x) \right) + \lambda \cdot \Omega(\theta)

di mana fsimf_{\text{sim}} adalah model simulasi, frealf_{\text{real}} adalah perilaku klaster 10K GPU nyata, dan Ω(θ)\Omega(\theta) adalah istilah regularisasi.

1.2 Prinsip Teknis Inti

Inovasi inti PrismLLM adalah kemampuan untuk mensimulasikan perilaku pelatihan klaster masif hanya dengan menggunakan beberapa GPU, dengan kesalahan yang sangat rendah (di bawah 1%).

真实万卡集群Klaster 10K GPU Nyata行为采集模块Profil Perilaku通信模式分析Pola Komunikasi计算特性建模Karakterisasi Komputasi内存访问追踪Jejak Akses Memori高保真仿真引擎Mesin PrismLLM小规模硬件Beberapa GPU训练行为预测Simulasi Pelatihan超参数调优Pencarian Hiperparameter故障预测Prediksi Kegagalan成本估算Estimasi Biaya

1.3 Fitur Teknis Utama

Fitur Deskripsi Keunggulan
Kesalahan simulasi < 1% Penyimpangan dari hasil klaster 10K GPU nyata dalam 1% Akurasi prediksi sangat tinggi
Simulasi topologi komunikasi Menstimulasi pola komunikasi kolektif seperti all-reduce, all-gather secara akurat Tidak perlu lingkungan jaringan nyata
Strategi paralel hibrida Mendukung simulasi gabungan paralelisme data, model, dan pipeline Mencakup skema pelatihan arus utama
Pemodelan beban dinamis Mempertimbangkan faktor dinamis seperti fluktuasi penggunaan GPU, tekanan memori Lebih dekat dengan skenario nyata

1.4 Skenario Aplikasi

Pengurangan Biaya Riset=CnyataCsimulasiCnyata×100%95%\text{Pengurangan Biaya Riset} = \frac{C_{\text{nyata}} - C_{\text{simulasi}}}{C_{\text{nyata}}} \times 100% \approx 95%

  • Pencarian hiperparameter: Memilih konfigurasi optimal pada perangkat keras skala kecil
  • Prediksi kegagalan: Mengidentifikasi potensi masalah dalam pelatihan terdistribusi sejak dini
  • Estimasi biaya: Memperkirakan kebutuhan sumber daya untuk berbagai skala pelatihan secara akurat

Video: Pengenalan Teknis PrismLLM


2. PhysBrain: Belajar Fisika dari Video

2.1 Konsep Inti

PhysBrain adalah model dasar akal sehat fisika yang mempelajari hukum dunia fisik (seperti gravitasi, tabrakan, gesekan, dll.) dengan menonton video, sehingga secara signifikan meningkatkan kemampuan kontrol robot.

a^t=argmaxaP(ast,Kphysics)\hat{a}t = \arg\max_a P(a | s_t, \mathcal{K}{\text{physics}})

di mana Kphysics\mathcal{K}_{\text{physics}} mewakili basis pengetahuan akal sehat fisika yang dipelajari model dari video.

2.2 Arsitektur Model

PhysBrain 核心输出视频输入动力学预测器Prediktor Dinamika$\phi_d$视觉编码器Encoder Visual $\phi_v$物理规则Hukum Fisika物体属性Properti Objek控制策略Kebijakan Kontrol $\pi$物理推理模块Penalar Fisika $\phi_p$机器人执行Aksi Robot视频帧序列$V = (v_1, v_2, ..., v_T)$

2.3 Matriks Kemampuan Utama

Capability=[重力感知碰撞预测摩擦力建模流体动力学刚体运动材料属性因果关系状态转移环境交互]\mathbf{Capability} = \begin{bmatrix} \text{重力感知} & \text{碰撞预测} & \text{摩擦力建模} \ \text{流体动力学} & \text{刚体运动} & \text{材料属性} \ \text{因果关系} & \text{状态转移} & \text{环境交互} \end{bmatrix}

2.4 Kinerja dalam Pengujian Kecerdasan Tertubuh

25%20%18%15%12%10%物体抓取推拉操作投掷预测堆叠稳定性工具使用导航避障PhysBrain 具身智能测试夺冠领域

Lingkungan Pengujian:

Platform Jenis Tugas Peringkat PhysBrain
SAPIEN Manipulasi objek berartikulasi #1
MuJoCo Kontrol berkelanjutan #1
Habitat Navigasi visual #1
Isaac Sim Perakitan industri #1

Robotics Vision


3. Elastic DiT: Terobosan Baru dalam Generasi Gambar Real-Time di Perangkat Seluler

3.1 Definisi Masalah

Model difusi tradisional (seperti Flux, Stable Diffusion) menghadapi trade-off yang berat antara kualitas dan latensi di perangkat seluler:

Quality1Latency×Computation\text{Quality} \propto \frac{1}{\text{Latency} \times \text{Computation}}

Elastic DiT (Elastic Diffusion Transformer) mematahkan kendala ini melalui penyesuaian parameter dinamis.

3.2 Mekanisme Penjadwalan Parameter Dinamis

弹性调度器输入层DiT 核心注意力稀疏化Atensi Jarang配置 A: 极速模式Lat: < 50ms配置 B: 均衡模式Lat: 200-500ms配置 C: 画质模式Lat: 1-2s设备信息Info Perangkat动态深度$d \in [4, 32]$动态宽度$w \in [256, 1024]$生成图像Gambar yang Dihasilkan质量偏好Preferensi Kualitas弹性调度器Penjadwal Elastis用户请求Permintaan Pengguna

3.3 Formulasi Matematis

Forward pass Elastic DiT dapat dinyatakan sebagai:

xt1=αtxt+σtE(xt,t,c;θ(d,w))\mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \cdot \mathcal{E}(\mathbf{x}_t, t, c; \theta(d, w))

di mana parameter penjadwalan (d,w)(d, w) ditentukan secara dinamis oleh kondisi perangkat dan persyaratan kualitas:

(d,w)=argmind,wL(θ(d,w))+μT(d,w,device)(d^, w^) = \arg\min_{d,w} \mathcal{L}(\theta(d,w)) + \mu \cdot T(d,w, \text{device})

3.4 Perbandingan Kinerja

Model Perangkat Latensi FID Resolusi
Flux-dev RTX 4090 2.1s 5.2 1024x1024
SDXL RTX 4090 3.5s 6.1 1024x1024
Elastic DiT (Kecepatan) iPhone 16 < 50ms 6.8 512x512
Elastic DiT (Seimbang) iPhone 16 300ms 5.0 1024x1024
Elastic DiT (Kualitas) iPhone 16 1.2s 4.3 1024x1024

Mode kecepatan mencapai kualitas gambar melampaui model Flux di perangkat seluler!

Mobile AI


4. IVGT: Kerangka Rekonstruksi 3D Implisit

4.1 Ikhtisar Teknis

IVGT (Implicit Volume Geometry Transformer) adalah kerangka rekonstruksi 3D implisit inovatif yang dapat secara otomatis membangun geometri 3D kontinu dari gambar 2D biasa dan mencapai rendering presisi tinggi.

4.2 Jalur Teknis

多视角/单张图片深度特征图NeRF/隐式SDF场体积渲染优化Marching Cubes提取三角网格 +PBR材质交互式3D模型图像编码器特征提取隐式场构建网格生成渲染输出用户输入用户输入图像编码器特征提取隐式场构建网格生成渲染输出

4.3 Representasi Implisit

IVGT menggunakan fungsi jarak bertanda implisit (SDF) untuk merepresentasikan geometri 3D:

f(x;θ):R3Rf(\mathbf{x}; \theta): \mathbb{R}^3 \rightarrow \mathbb{R}

di mana:

  • f(x)=0f(\mathbf{x}) = 0 mewakili permukaan objek
  • f(x)>0f(\mathbf{x}) > 0 mewakili bagian luar objek
  • f(x)<0f(\mathbf{x}) < 0 mewakili bagian dalam objek

Medan implisit diubah menjadi gambar melalui persamaan rendering volume:

C^(r)=tntfT(t)σ(r(t))c(r(t),d)dt\hat{C}(\mathbf{r}) = \int_{t_n}^{t_f} T(t) \cdot \sigma(\mathbf{r}(t)) \cdot \mathbf{c}(\mathbf{r}(t), \mathbf{d}) , dt

di mana transmitansi:

T(t)=exp(tntσ(r(s))ds)T(t) = \exp\left( -\int_{t_n}^{t} \sigma(\mathbf{r}(s)) , ds \right)

4.4 Kinerja dalam Tugas Rekonstruksi Mesh

Metode Chamfer-L1 ↓ F-Score ↑ Waktu Pelatihan Persyaratan Input
NeRF 0.085 0.72 12h Multi-sudut pandang
NeuS 0.062 0.81 8h Multi-sudut pandang
VolSDF 0.058 0.84 10h Multi-sudut pandang
IVGT 0.031 0.93 2h Tunggal/Multi-sudut pandang

5. Perbandingan Komprehensif dan Prospek Tren

5.1 Ikhtisar Perbandingan Empat Teknologi

应用层研究层共同目标弹性DiTGenerasi Gambar Seluler普惠AI技术降低AI门槛IVGTRekonstruksi 3DPrismLLMSimulasi PelatihanPhysBrainPemahaman Fisika

5.2 Analisis Kuantitatif Tren Perkembangan

AI 技术研究热度趋势(2024-2026)01002003004005002024 Q12024 Q32025 Q12025 Q32026 Q12026 Q2论文发表量 (估算)

5.3 Ringkasan Rumus Utama

Teknik Rumus Inti Tujuan
PrismLLM minL(fsim,freal)+λΩ\min \mathcal{L}(f_{\text{sim}}, f_{\text{real}}) + \lambda\Omega Simulasi perilaku pelatihan
PhysBrain a^t=argmaxP(ast,K)\hat{a}_t = \arg\max P(a | s_t, \mathcal{K}) Pengambilan keputusan sadar fisika
Elastic DiT xt1=αtxt+σtE(;θ(d,w))\mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \mathcal{E}(\cdot; \theta(d,w)) Inferensi dinamis
IVGT C^(r)=T(t)σ(r(t))c()dt\hat{C}(\mathbf{r}) = \int T(t)\sigma(\mathbf{r}(t))\mathbf{c}(\cdot)\,dt Rendering volume

5.4 Prospek Masa Depan

PrismLLM akan mengurangi biaya riset pelatihan model besar sebesar 95% atau lebih, memungkinkan akademisi berpartisipasi dalam riset model mutakhir.

PhysBrain membuka jalan bagi robot serba guna — robot rumah tangga dengan “akal sehat” sungguhan diharapkan dalam 3-5 tahun.

Elastic DiT menandai datangnya generasi gambar AI praktis di perangkat seluler — kreasi AI real-time di ponsel akan menjadi standar.

Kemampuan rekonstruksi 3D gambar tunggal IVGT akan merevolusi pengembangan game dan alur kerja pembuatan konten AR/VR.


Referensi

Makalah

Sumber Daya Video

Proyek Sumber Terbuka


Dokumen ini disusun oleh AI News Daily pada 2026/5/19, terus melacak perkembangan riset AI mutakhir.

Share this page