个人优势
长期专注具身智能前沿方向,对视觉语言导航、视觉语言动作模型及多模态大模型的核心思路与技术脉络有系统性把握,算法功底扎实、研究视角清晰。兼具较强的工程动手能力与机器人竞赛积累,擅长将学术方法迁移到真实机器人本体上,独立推动课题从原理设计、代码实现到实机验证的全流程落地。
教育背景
北京大学 机器人工程 · 本科
专业排名:专业前 30%
2020 – 2024
985
专业技能
研究方向
视觉语言导航(VLN)、视觉语言动作模型(VLA)、多模态大模型、行为树任务规划
核心方法
VGGT 空间几何表征、BEV 空间表示、时序记忆压缩、Instruction Tuning、DAgger、行为克隆
机器人平台
宇树 Unitree GO2、云深处 Lite3 四足机器人、Piper 机械臂
模型实践
π (Pi) VLA 模型微调、多模态大模型部署、感知-导航-控制链路适配
工作经历
某所高等技术研究院
2027.04 – 2027.07
算法研究(Python)
- VLN 模型部署与跨平台迁移:部署 VLN 模型至 Unitree GO2 机器狗,完成感知、导航与运动控制链路适配;进一步迁移至云深处 Lite3,完成底层接口、传感器输入与执行模块的跨平台适配。
- 机器人数据采集流程实现:基于 Piper 机械臂搭建并优化自动抓取、目标分类放置与 VLA 数据采集流程,提升真实场景下数据采集的自动化程度与任务稳定性,为后续模型训练提供高质量交互数据。
- VLA 模型真实场景微调:基于 π 模型针对 Piper 机械臂进行真实场景微调,构建抓取任务训练与评估流程,在指定物体抓取任务中实现 90% 以上成功率。
项目经验
面向单目 RGB 输入的多模态视觉语言导航方法研究
2027.01 – 2027.05
负责人
核心目标:面向单目 RGB 输入的视觉语言导航任务,研究基于多模态大模型的空间建图与长程决策方法,提升复杂室内场景下的导航鲁棒性与连续规划能力。
- 空间感知增强:基于 VGGT 从单目 RGB 视频流中估计深度与相机位姿,利用跨子图重叠帧进行尺度对齐,构建鸟瞰图(BEV)空间表示,并引入显式方向编码增强空间感知能力。
- 记忆增强的导航决策:构建短期记忆维护局部观测与历史动作,提升连续动作执行的一致性;设计长期记忆记录全局探索轨迹、关键节点与空间关系,增强复杂场景下的长程路径规划能力。
- 连续动作规划优化:基于历史记忆与空间表示生成连续动作序列,减少逐步推理带来的模型调用开销,提升导航动作连贯性与推理效率。
长时序视觉语言导航中的历史记忆压缩机制研究
2026.10 – 2026.12
负责人
研究目标:面向长时序视觉语言导航任务,研究空间几何信息与视觉语义特征的融合方法,优化导航模型在长历史轨迹下的上下文记忆与推理能力。
- 空间语义建模:复现并分析 VLN 双隐式记忆结构与导航推理流程,研究基于 VGGT 的空间几何表征与视觉语义特征的融合方式,理解空间记忆与语义记忆在导航任务中的协同机制。
- 时序记忆压缩:针对长轨迹历史帧带来的 token 冗余与显存开销问题,参考渐进式 memory 机制,设计历史观测压缩缓存模块,对远距离历史帧进行高比例压缩,同时保留近期观测细粒度信息,在控制输入序列长度的同时提升长程上下文覆盖能力。
- 训练与推理优化:完成导航模型两阶段训练流程搭建,结合 Instruction Tuning 与 DAgger 策略进行轨迹数据迭代采样与行为克隆训练,适配增量式 memory 推理流程,并完成初步实验验证。
基于大模型的行为树生成与机器人行动规划研究
2026.04 – 2026.09
负责人
项目背景:面向真实机器人任务执行场景,研究基于大模型生成行为树的任务规划方法,实现高层语义任务到机器人动作的自动映射。
- 平台搭建与能力封装:搭建四足机器人实物验证平台并完成底层能力抽象与接口封装,将运动、抓取等执行能力标准化为行为树节点,建立上层任务规划与底层动作执行之间的统一映射,为大模型生成规划的实体落地提供支撑。
- 规划生成与落地验证:针对机器人实体任务执行场景,完成相关 Prompt 编写与优化,解析大模型输出并构建行为树,确保任务规划可精准落地到机器人实体动作,完成真实机器人场景下的任务规划与动作执行验证。
能力标签
具身智能
视觉语言导航 VLN
视觉语言动作 VLA
多模态大模型
四足机器人
机械臂操作
Sim-to-Real
行为树规划
Python
C++