XPENG-AI/X-AuT
Automatic Speech Recognition • 0.9B • Updated • 221 • 8
LLM, VLM, Omni Model, Agent, VLA
VGGT-Diff: Visual Geometry Meets Diffusion for Sparse-View Novel View Synthesis
X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation