2029 届硕士生 · Agent / 后训练 / 多模态 AI

王博中

AI 算法工程师方向

华南理工大学未来技术学院人工智能硕士研究生。关注 Tool-use Agent、长程任务 harness、轨迹蒸馏与低成本大模型落地,正在把足球领域智能体与流式视频理解 沉淀为可复现的模型、数据和评测闭环。

1/128
本科专业排名
72.5%
observation 使用率
68.6 万
项目视频 clips
2 项
国家级一等奖

Education

教育经历

2026.09 - 2029.06

华南理工大学(985)

未来技术学院 · 人工智能 · 保研

2022.09 - 2026.06

西南大学(211、双一流)

软件工程 · 专业排名 1 / 128

Awards

荣誉竞赛

CET-4 565 · CET-6 569 一等奖学金、二等奖学金、校级三好学生 中国机器人与人工智能大赛国家级一等奖 大唐杯国家级一等奖

Internship

实习经历

咪咕视讯科技有限公司

StreamSoccer · 基于分层事件记忆的流式足球视频理解系统

参与研发 Qwen3-VL 驱动的三级流式视频理解系统,以 query-based Clip Event Adapter、 9-token gated STM、MemoryProjector 与 LoRA,将连续视觉流压缩为因果事件状态, 支持当前、局部和长时三层足球解说。

  • 参与数据与实验工程:项目将 500 场 SoccerNet 比赛整理为 685,903 个 4 秒 clip 和 166,419 个因果事件,并融合 SN-Caption、MatchTime 构建 27,639 条分层解说样本。
  • 参与 Qwen 视觉缓存与实验链路审计:项目在 1,000 个半场、685,903 个 clip 上实现 100% 缓存覆盖,并完善数据 schema、训练、消融、指标与 checkpoint 管理。
  • 参与流式推理与评测治理:系统在 63 场测试比赛、86,145 个 clip 上生成 5,949 条 时间感知解说,并通过 match-level split、causal cutoff、evidence provenance 与 prompt leakage 审计保障评测可追溯。
Qwen3-VL Streaming VLM Hierarchical Memory LoRA SoccerNet
咪咕视讯科技有限公司

大模型算法工程师 · 足球领域 Tool-use Agent 轨迹蒸馏

将原始 SoccerAgent 改造为可执行、可回放、可过滤的 trajectory harness,支持 task、tool、action、observation、reward schema 与 SFT / DPO / OPD-like 数据导出。

  • 使用 DeepSeek V4 生成候选工具调用轨迹,通过 harness 执行 SoccerWiki / GameDataset 检索工具。
  • 基于 evidence coverage、tool validity、answer correctness 等指标过滤高质量轨迹, 蒸馏 Qwen2.5-7B-Instruct LoRA planner。
  • 设计 A/B 实验矩阵,对比原始 Agent、harness-enhanced Agent、base Qwen 与 SFT planner;小样本预研中 observation 使用率由 17.5% 提升至 72.5%,重复搜索和 max-step 问题降为 0。
SoccerAgent Tool-use LoRA Planner Trajectory Filtering

Technical Stack

技术能力

后训练与数据

LoRA / QLoRA SFT 数据构造 DPO PPO GRPO OPD-like

Agent 与工具调用

Tool-use Agent trajectory harness runtime checks failure taxonomy TAU2-Bench

大模型与工程

Qwen2.5 / Qwen3.5 DeepSeek V4 Python schema design 数据导出与过滤

Contact

期待研究型实习与算法工程机会

Tool-use Agent · 后训练 · 多模态足球智能 · 长程任务评测