Researcher & Founder

Pengxiang Ding 丁鹏翔

I am the founder and CEO of Symbiosis Robotics (共生知行), where we build foundation models for whole-body humanoid intelligence.

My research focuses on vision-language-action models and whole-body control.

I am a Ph.D. student at Zhejiang University in a joint program with Westlake University, advised by Prof. Donglin Wang in the Machine Intelligence Laboratory (MiLAB).

Previously, I received my M.Sc. from the School of Artificial Intelligence at BUPT in 2022, advised by Prof. Jianqin Yin.

Pengxiang Ding as a child
Hangzhou, China
Symbiosis Robotics共生知行
From Humanoid to Human

News

Scroll for earlier updates

Selected publications 21

Google Scholar

First author or project leader. * Equal contribution   † Project leader

NeurIPS

Endowing Your Vision-Language-Action Model with a Predictive Mind

Pengxiang Ding, Haoying Wang, Minghui Lin, Qishen Wang, Zhenyu Ding, Runze Suo, Xuanxuan An, Wenxuan Song, Fuhao Li, Han Zhao, Donglin Wang, Ning Ding

CoRL

SAGE-3D: Semantic-Aware 3D Representations for Generalizable Vision-Language-Action Models

Pengxiang Ding, Xuanxuan An, Kexian Yu, Haoying Wang, Minghui Lin, Xuhao Wan, Wenxuan Song, Han Zhao, Yihao Wang, Donglin Wang, Ning Ding

ECCV

Towards More Efficient Decoding for Autoregressive Vision-language-action Models

Wenxuan Song*, Jiayi Chen*, Pengxiang Ding†, Yuxin Huang, Han Zhao, Yinchuan Li, Yingcong Chen, Donglin Wang, Haoang Li

CVPR

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

Minghui Lin, Pengxiang Ding†, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang†, Donglin Wang

CVPR

CUBic: Coordinated Unified Bimanual Perception and Control Framework

Xingyu Wang*, Pengxiang Ding*†, Jingkai Xu, Donglin Wang, Zhaoxin Fan

ICLR

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

Jiayi Chen*, Wenxuan Song*, Pengxiang Ding†, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

ICRA

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

Jiacheng Liu*, Pengxiang Ding†*, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

AAAI

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model

Yihao Wang*, Pengxiang Ding†*, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang

CoRL

Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation

Yiguo Fan†, Pengxiang Ding†,Shuanghao Bai†, Xinyang Tong†, Yuyang Zhu, Hongchao Lu, Fengqi Dai, Wei Zhao, Yang Liu, Siteng Huang, Zhaoxin Fan, Badong Chen, Donglin Wang

ICCV

CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction

Zhefei Gong*, Pengxiang Ding†, Shangke Lyu, Siteng Huang, Mingyang Sun, Wei Zhao, Zhaoxin Fan, Donglin Wang

NeurIPS

SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning

Yang Liu†, Ming Ma†, Xiaomin Yu†, Pengxiang Ding†, Han Zhao, Mingyang Sun, Siteng Huang, Donglin Wang

arXiv

Humanoid-vla: Towards universal humanoid control with visual integration

Pengxiang Ding†, Jianfei Ma†, Xinyang Tong†, Binghong Zou, Xinxin Luo, Yiguo Fan, Ting Wang, Hongchao Lu, Panzhong Mo, Jinxin Liu, Yuefan Wang, Huaicheng Zhou, Wenshuo Feng, Jiacheng Liu, Siteng Huang, Donglin Wang

IROS

Accelerating vision-language-action model integrated with action chunking via parallel decoding

Wenxuan Song†, Jiayi Chen†, Pengxiang Ding†, Han Zhao, Wei Zhao, Zhide Zhong, Zongyuan Ge, Jun Ma, Haoang Li

ICML

Rethinking Latent Representations in Behavior Cloning:An Information Bottleneck Approach for Robot Manipulation

Shuanghao Bai*, Wanqi Zhou*, Pengxiang Ding†, Wei Zhao, Donglin Wang, Badong Chen

ICRA

QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning

Xinyang Tong†, Pengxiang Ding†, Donglin Wang, Wenjie Zhang, Can Cui, Mingyang Sun, Yiguo Fan, Han Zhao, Hongyin Zhang, Yonghao Dang, Siteng Huang, Shangke Lyu

ICLR

GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation

Hongyin Zhang, Pengxiang Ding†, Shangke Lyu, Ying Peng, Donglin Wang

ICLR

VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation

Wei Zhao, Pengxiang Ding†, Zhang Min, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang

ECCV

QUAR-VLA: Vision-Language-Action Model for Quadruped Robots

Pengxiang Ding, Han Zhao, Wenxuan Song, Wenjie Zhang, Min Zhang, Siteng Huang, Ningxi Yang, Donglin Wang

ECCV

PiTe: Pixel-Temporal Alignment for Large Video-Language Model

Yang Liu†, Pengxiang Ding†, Siteng Huang, Min Zhang, Han Zhao, Donglin Wang

AAAI

Expressive Forecasting of 3D Whole-body Human Motions

Pengxiang Ding, Qiongjie Cui, Min Zhang, Mengyuan Liu, Haofan Wang, Donglin Wang

TCSVT

Towards more realistic human motion prediction with attention to motion coordination

Pengxiang Ding, Jianqin Yin

Other publications 8

2026
ECCV

Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance

Wenxuan Song, Jiayi Chen, Shuai Chen, Jingbo Wang, Pengxiang Ding, Han Zhao, Yikai Qin, Xinhu Zheng, Yan Wang, Donglin Wang, Haoang Li

ICML

Dyn-VPP: Video Prediction Policy Optimization for Improved Visual Dynamics

Zirui Ge, Pengxiang Ding, Baohua Yin, Yemin Wang, Qishen Wang, Zhiyong Xie, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Haoang Li, Ran Cheng, Cheng Chi, Hui-Bin Ge, Yaozhi Luo, Donglin Wang

ICRA

Rethinking the Practicality of Vision-Language-Action Model: A Comprehensive Benchmark and an Improved Baseline

Wenxuan Song, Jiayi Chen, Xiaoquan Sun, Huashuo Lei, Yikai Qin, Wei Zhao, Pengxiang Ding, Han Zhao, Tongxin Wang, Pengxu Hou, Zhide Zhong, Haodong Yan, Donglin Wang, Jun Ma, Haoang Li

ICRA

Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling

Zhefei Gong, Shangke Lyu, Pengxiang Ding, Wei Xiao, Donglin Wang

ICLR

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

Fuhao Li, Wenxuan Song, Han Zhao, Jingbo Wang, Pengxiang Ding, Donglin Wang, Long Zeng, Haoang Li

AAAI

ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver

Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li

AAAI

Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration

Yuhang Han, Xuyang Liu, Zihan Zhang, Pengxiang Ding, Junjie Chen, Honggang Chen, Donglin Wang, Qingsen Yan, Siteng Huang

AAAI

Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach

Hangyu Liu, Bo Peng, Pengxiang Ding, Donglin Wang

Experience

  1. –

    Xiaomi 小米

    Intern

  2. –

    Ant Group · Robbyant

    Intern 蚂蚁灵波

  3. Jan 2025–Jun 2025

    DAMO Academy

    Research Intern · Machine Intelligence Laboratory

    Advisor: Xin Li

  4. Sep 2022–Mar 2023

    RedBook

    Research Intern · Intelligent Creation Group

    Advisor: Haofan Wang

  5. Sep 2021–Mar 2022

    SenseTime

    Research Intern · Smart City Group

    Advisor: Dongliang Wang

Academic service

Journal & conference reviewer

ICML, ICLR, NeurIPS, CVPR, ICCV, ACM MM, AAAI, ICRA, IROS, CoRL, TNNLS, TASE, TCSVT

Elsewhere

You can also find me on Redbook .

Talks & discussions 7

  1. Talk

    What Are AI Builders Changing? 

    Chongli Forum · AI Builders Show · 甲子光年

  2. Panel discussion

    World Models, Robot Intelligence, and Control 

    WRC 2026 Developer After Party · 北京人形 / Xbotics

  3. Conference talk

    Advancing VLA Models across Robot Embodiments 

    EAIRCon 2025 · Shenzhen · 智猩猩 / 智东西

  4. Joint session

    VLA Foundations, Reinforcement Learning, and Dexterous Manipulation 

    Lumina Talk #19 · Westlake MiLAB

  5. Online talk

    Full-Stack VLA: From Visuomotor Policies to Robot Foundation Models 

    3D Vision Workshop · 3D 视觉工坊

  6. Open lecture

    End-to-End Foundation Models for Quadruped Robots 

    Shenlan Academy · 深蓝学院

  7. Research talk

    Vision-Language-Action Models

    Peking University · Hosted by Hao Dong

Interviews & features