English
苏军又的照片

苏军又Junyou Su

北京大学 学术型硕士在读·字节跳动 Seed(Foundation Model)实习生

中国深圳

以数据为中心的大模型训练 —— 数据合成、数据筛选、稳定对齐。

关于

我是北京大学深圳研究生院学术型硕士生,导师为张文佳教授,目前在字节跳动 Seed 的 Seed Speech 团队实习,负责语音基座模型(speech foundation model)相关的数据工作。

我的研究以数据为中心:训练数据的筛选、合成与加权如何决定大模型在后训练后的能力上限。近期工作包括数据筛选(InstructDiff,ACL 2026)、稳定对齐(ASFT,ICLR 2026,已合入 LLaMA-Factory)与指令数据合成(TAG-INSTRUCT,ACL 2025 Findings)。

同时我也在做 PlanGPT 系列:面向规划领域的大模型,从最初的 PlanGPT 到视觉语言版 PlanGPT-VL,后续工作仍在进行。另外,我作为技术负责人为三家规划院所交付了 RAG 系统。

研究兴趣数据筛选与合成·大模型后训练与对齐·领域大模型与多模态·时空智能

近期动态

2026.04
InstructDiffACL 2026 主会接收。
2026.02
ASFT 合入 LLaMA-Factory
2026.02
加入字节跳动 Seed(Seed Speech 团队)实习,负责 Seed-Audio 数据工作。
2026.01
ASFTICLR 2026 接收。
2025.11
PlanGPT-VL 发表于 EMNLP 2025 Industry Track。
2025.09
入学北京大学深圳研究生院,开始硕士阶段学习。

代表性论文

InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning

ACL 2026

Junyou Su*, He Zhu*, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

计算语言学协会年会(ACL)主会

  • 提出 Warmup 校准 + 分布感知过滤的统一范式:用对比熵信号识别最具可学习性的样本,不再依赖人工的领域启发式规则。
  • 仅用 10% 数据即超过全量训练:数学推理相对提升 17%,通用指令相对提升 52%,并在医疗问答与代码任务上复现。

Anchored Supervised Fine-Tuning

ICLR 2026

He Zhu*, Junyou Su*, Peng Lai*, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

国际表征学习大会(ICLR)·已合入 LLaMA-Factory

  • 动态样本加权结合轻量级 KL 锚定,解决 Dynamic Fine-Tuning 的训练漂移问题。
  • 首次将 DFT 统一进 Reward-Weighted Regression 框架,证明其下界比 SFT 更紧、收敛更稳定。
  • 在数学推理、医学问答与代码生成上稳定提升,计算成本约为全量 RL 训练的 3%;ASFT-LoRA 变体显存降低 50% 仍保持增益。

PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models

EMNLP 2025

He Zhu*, Junyou Su*, Minxin Chen*, Wen Wang, Yijie Deng, Guanhua Chen, Wenjia Zhang

自然语言处理经验方法会议(EMNLP)Industry Track

  • 提出 PlanAnno-V 框架,为国土空间规划图件合成高质量视觉问答数据。
  • 关键点思维机制通过结构化验证逐步核对答案,显著减少幻觉。
  • 发布 PlanBench-V 基准,评测模型对规划图件的识读能力。

TAG-INSTRUCT: Controlled Instruction Complexity Enhancement through Structure-based Augmentation

ACL 2025 Findings

He Zhu, Zhiwen Ruan, Junyou Su, Xingwei He, Yun Chen, Wenjia Zhang, Guanhua Chen

计算语言学协会年会(ACL)Findings

  • 首创将指令压缩到紧凑的标签空间,再通过强化学习引导的标签扩展重建指令。
  • 让指令复杂度成为可控的旋钮,而不是提示改写的副产物,跨基准表现更稳定。

DUET: Relational Query-Level Uncertainty at the Assistant Boundary

在审

Junyou Su, Wen Wang, Yurun Wang, Junyang Chen, Wenjia Zhang

  • 只读目标模型与若干固定同伴在提示末端的下一 token 分布,不生成任何答案 token。
  • 免训练、免标注:在同一批 prefill 上,跨模型一致性比纯置信度基线高 2.45 个 macro AUROC。

* 共同一作(贡献相同)。

预印本

FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only

arXiv:2408.01323

He Zhu, Junyou Su, Tianle Lun, Yicheng Tao, Wenjia Zhang, Zipei Fan, Guanhua Chen

  • 仅用开源模型从无标注文本端到端合成指令数据:预筛选 → 种子生成 → UCB 动态增强。
  • 1 万条合成数据在 AlpacaEval 2.0 与 Arena-Hard 上优于 Alpaca-GPT4、WizardLM。

PlanGPT: Enhancing Urban Planning with Tailored Language Model and Efficient Retrieval

arXiv:2402.19273

He Zhu, Wenjia Zhang, Nuoxian Huang, …, Junyou Su, … (12 authors)

  • 面向中文国土空间规划文本的定制大模型与高效检索系统,PlanGPT 系列的起点。

教育背景

实习与研究经历

落地项目

规划知识问答大模型(RAG)

2025.03 – 2025.06

北京市城市规划设计研究院 · 技术负责人

  • 基于高效 OCR 处理海量扫描规划文本并构建结构化知识库;分层检索实现精准低延迟的 RAG;支持语音输入优化交互。

规划知识问答与智慧审查系统(RAG)

2024.09 – 2024.12

中国城市规划设计研究院(深圳) · 技术负责人

  • 用大模型对院内规划文件分库处理并构建知识库,结合分层检索落地面向院内知识与互联网信息的智能问答与智慧审查系统。

其他项目

  • 深圳市海洋发展研究促进中心 —— 参与开发基于 RAG 的规划文本审查智能体。
  • 本科毕业论文(2024.09–2025.06,校级优秀毕业论文)—— 利用大模型构建海事新闻分析智能体,提升船舶到港时间预测精度。
  • Mobility Agent(2024.10–2025.03,与东京大学合作)—— 基于 LangChain 的智能体工作流与工具集,实现自然语言驱动的时空数据分析。

技能

编程语言
Java, Python > C++, C, SQL > Go, Vue, JavaScript > Verilog, MATLAB
大模型
数据合成与筛选、SFT / LoRA 微调、强化学习后训练、提示工程、检索增强生成、智能体与多智能体模拟、Deep Research
工程能力
前后端全栈开发;分布式训练与评测链路搭建;LLaMA-Factory 开源贡献者

获奖情况

2025
南方科技大学优秀毕业生(校级)、优秀毕业论文(校级)
2023, 2024
南方科技大学优秀学生称号(校级)
2022–2024
南方科技大学优秀学生奖学金三等奖
2023
全国大学生数学建模竞赛省级三等奖
2021
南方科技大学新生奖学金二等奖