5 articles
Baidu's PaddleOCR has become the most-starred OCR project on GitHub, surpassing Tesseract and marking a decisive shift toward AI-driven document recognition.
Baidu's VEGA-3D uses video diffusion models to boost 3D spatial reasoning in multimodal AI - no explicit geometric supervision needed.
Baidu's Qianfan-DeepResearch Pro has secured first place on the DeepResearch Bench leaderboard, outperforming competing AI research agents in end-to-end autonomous research capabilities.
Baidu unveils ERNIE 5.0, a next-generation omni-modal AI model that processes text, images, audio, and video through a single unified framework, featuring 2.4 trillion parameters with under 3% activation per inference for efficient multimodal reasoning.
Baidu has announced ERNIE 5.0, a new omni-modal AI model showing impressive benchmark results across text, vision, audio, and image generation.
We use cookies to improve your experience on our site and to show you relevant advertising. To find our more, read our privacy policy and cookie policy