沈奕江头像

Multimodal / VLM / Computer Vision

你好,我是沈奕江

北京航空航天大学信息与通信工程硕士在读,求职方向为多模态/VLM 算法。我的项目重点放在数据构造、模型推理、评测归因、科研实验和工程复现。

Project Evidence 查看 4 个可展开项目案例

Resources

多模态/VLM 算法求职作品集

About

把算法项目做成可复现、可评测、可汇报的工程证据。

查看能力地图

76.32%

MMBench grouped accuracy

VLMEvalKit
SFT VLM SAR YOLO LoRA CV
SAR 多通道融合预览图

Stack I use.

Qwen3-VL VLMEvalKit PyTorch MMDetection YOLO Python OpenCV JSON
FSMD-Net 相位重构工程图

Service 01

Algorithm engineering

从样本、脚本、指标到图表,把算法项目组织成可以追溯的闭环。

Let’s talk about projects

15101187760@163.com

Capability Map

把视觉任务、评测诊断、模型实现和工程复现连成一条清晰链路

页面重点不再只罗列经历,而是把每项能力落到项目证据、代码模块、实验结果和可复现产物上。

01

VLM 任务与数据构造

围绕商品属性、视觉证据、风险识别、卖点生成和 Agent 动作构建多任务 SFT 样本。

证据:10 products / 50 SFT / Qwen-VL 格式转换
02

评测闭环与错误归因

从模型接入、prompt 构造、批量推理、exact matching 到 category 与 badcase 分析。

证据:MMBench 4876 raw rows / 76.32%
03

视觉模型研究基础

围绕 SAR 舰船检测做频谱建模、消融实验、跨数据集迁移和相位可解释分析。

证据:FSMD-Net / AP 0.572 / 跨域提升
04

工程实现与复现

保留配置、脚本、日志、测试与结果文件,让项目可被追溯、复跑和面试深挖。

证据:测试覆盖 / 训练脚本 / 指标 JSON

Featured Projects

项目案例展示

整体内容按 STAR 法则组织:先说明项目情境与目标,再讲我的行动组织方式,最后用结果指标和复盘结论证明项目价值。

Project 01 / VLM Data & SFT

基于 Qwen3-VL 的电商多模态商品理解系统

围绕电商商品图文理解场景,搭建一套可汇报、可复盘的多模态任务闭环,用小样本验证数据组织、任务拆解、推理评估和后续微调准备能力。

  • Qwen3-VL
  • SFT
  • JSON Metrics
  • LoRA / QLoRA Config
Products10
SFT Samples50
Tasks5
Metrics6
Split40 / 5 / 5
S

Situation

电商商品理解需要同时处理图片、标题、OCR、描述和类目信息,单一属性抽取难以覆盖真实运营场景。

T

Task

把任务拆成属性识别、视觉证据、风险判断、卖点生成和运营动作建议,形成可训练、可评估的数据闭环。

A

Action

按数据层、任务层、执行层、评估层组织工程结构,并保留 LoRA/QLoRA 与 Qwen-VL 格式的后续扩展入口。

R

Result

完成 10 个商品样本到 50 条多任务样本的闭环验证,输出 6 类评估指标和可展示的样例结果。

工程结构

  1. 数据层统一商品图像、标题、类目、OCR 与描述字段
  2. 任务层把商品理解拆解为五类可训练任务
  3. 执行层先用轻量 baseline 打通端到端流程
  4. 评估层从格式、属性、证据、风险和动作维度验证输出质量
  5. 训练准备层沉淀为 Qwen-VL 训练格式,方便后续微调

商品理解样例

ABO 灰色针织休闲鞋商品图 ABO 家居床榻场景商品图 ABO 蓝色主石戒指商品图
{
  "task": "visual_evidence",
  "category": "鞋靴/休闲鞋",
  "evidence": [
    {"attribute": "color", "value": "灰色", "source": "image"},
    {"attribute": "material", "value": "针织织面", "source": "image"}
  ]
}
  • 数据组织把原始商品信息整理成统一样本入口,保证不同任务共享同一套商品上下文。
  • 任务构造围绕商品理解拆出五类输出目标,让项目从“能识别”提升到“能解释、能决策”。
  • 执行验证用轻量 baseline 先验证全链路,避免一开始被大模型训练成本卡住。
  • 结果沉淀输出指标文件与训练格式,为后续真实模型微调和效果对比留下接口。
JSON Valid1.00
Category1.00
Attribute F11.00
Evidence1.00
Risk Macro F11.00
Agent Action1.00

当前项目定位是小样本闭环验证,重点证明我能把业务场景拆成可训练任务、可评估指标和可扩展工程结构;真实 Qwen3-VL 推理与 LoRA 训练可作为下一阶段里程碑继续推进。

Project 02 / Evaluation & Error Attribution

多模态大模型视觉能力评测与错误归因系统

围绕多模态模型评测岗位需求,搭建从 benchmark 跑分到错误归因的分析闭环,把一次模型评测沉淀为能指导数据、prompt 和模型迭代的诊断报告。

  • VLMEvalKit
  • MMBench
  • Badcase
  • Exact Matching
Raw rows4876
Grouped rows1292
Overall76.32%
Infer fail0%
Judge fail0%
S

Situation

多模态模型评测不能只看 overall 分数,招聘和业务更关心模型在哪些视觉能力上强、哪些环节会失败。

T

Task

构建可复现的评测流程,并把 MMBench 结果拆解到类别、能力短板、混淆矩阵和代表 badcase。

A

Action

按模型接入、数据集管理、批量推理、答案解析、指标汇总、错误归因六层组织评测工程。

R

Result

完成 4876 条原始预测与 1292 个分组样本分析,得到 76.32% overall,并定位空间、物理推理等弱项。

评测工程结构

  1. 模型层统一不同 VLM 的调用与输出口径
  2. 数据层接入公开 benchmark 与自建验证集
  3. 推理层批量推理、失败记录、结果合并
  4. 评分层exact matching 与 judge 结果可追溯
  5. 分析层类别准确率、错误贡献和混淆矩阵
  6. 报告层把指标转成可汇报的模型诊断结论
SelfImage_MCQ_Balanced 去偏置验证结果
样本数 10 自建单选样本
命中率 100% exact matching
失败率 0.00% judge / infer
视觉预算 1MP sdpa attention

结论:消除答案位置全 A 偏置后,模型仍在 10 个自建单选样本上全部命中,说明结果不是由选项位置投机得到。

Answer Balance 答案位置分布
原始答案
A 10B 0C 0D 0
去偏置后
A 2B 3C 3D 2
模型预测
A 2B 3C 3D 2

结论:预测分布与去偏置后的标准答案一致,后续报告可把该实验作为“数据接入、判题规则、可视化链路均可用”的小样本验证。

强项类别

  • identity_reasoning98.04%
  • image_topic96.67%
  • image_scene95.83%
  • celebrity_recognition93.94%
  • social_relation93.55%

弱项类别

  • spatial_relationship40.00%
  • image_quality48.81%
  • physical_property_reasoning49.06%
  • object_localization52.86%
  • future_prediction54.00%
Physical / Logic68 错 / 153acc 55.56%
Spatial / Localization63 错 / 120acc 47.50%
OCR / Text37 错 / 134acc 72.39%
Identity / Social20 错 / 272acc 92.65%
Project 03 / Research & Visual Detection

FSMD-Net: SAR 舰船检测科研项目

围绕复杂近岸 SAR 舰船检测中的小目标、强杂波和域迁移问题,完成从方法设计、实验验证到审稿补充分析的科研闭环。

  • SCI JCR Q1
  • 学生第一作者
  • SARDet-100K
  • Frequency Modeling
Best K8
AP0.572
AP500.808
SARDet -> HRSID+0.0117 AP
Params65.792M
S

Situation

复杂近岸 SAR 场景中,船舶目标易受岸线、港口结构和相干斑影响,传统视觉特征难以稳定区分目标与背景。

T

Task

设计更适合 SAR 图像的频谱建模方案,并通过消融、跨数据集和复杂度分析证明方法有效性。

A

Action

围绕空间-通道频谱建模组织实验,补充 K 值、跨域、显著性、速度与可解释可视化等证据。

R

Result

K=8 时 AP 达 0.572,跨数据集迁移优于 DenoDet,并以较小参数开销支撑论文和返修材料。

FSMD-Net 网络结构图
网络结构与空间-通道频谱建模
FSMD-Net 与 baseline 对比总览
SARDet-100K checkpoint 对比总览
多尺度激活与频谱对比图
多尺度激活与频谱可视化

K 值消融

KAPAP50AP75APs
10.5660.7980.6310.569
40.5650.8020.6220.569
80.5720.8080.6380.575
160.5690.8030.6310.571

跨数据集迁移

TransferFSMD-NetDenoDetGain
SARDet -> HRSID0.53150.5198+0.0117
SARDet -> AIR-SARShip-2.00.43100.3958+0.0351
K 值消融实验图
K 值消融实验
跨数据集迁移实验图
跨数据集迁移
相位保留与边界几何分析图
相位证据与边界几何
Project 04 / Real SAR Engineering

FAIR-CSAR 真实散焦舰船数据集与 YOLOv8_CBAM 流程

面向真实散焦舰船检测数据不足的问题,搭建从复数 SLC 数据、运动线索生成、半自动标注到三通道检测训练的数据工程流程。

  • Complex SLC
  • SAR / TFD / RID
  • YOLOv8_CBAM
  • Dataset Tools
Scenes1406
Boxes3508
Static ship2736
Moving ship772
Missing assets0
S

Situation

真实 SAR 散焦舰船样本标注成本高,且静止/运动目标需要结合时频和多普勒线索才能更可靠地区分。

T

Task

建立半自动数据生产流程,减少纯人工筛选压力,并输出可直接用于检测模型训练的数据格式。

A

Action

按候选筛选、三通道生成、运动线索、GUI 复核、YOLO 导出、训练推理六个环节组织工程。

R

Result

形成 1406 个 ready scenes、3508 个候选框,缺失资产为 0,为后续真实数据训练提供基础。

真实数据工程结构

  1. 数据来源从 FAIR-CSAR 复数 SLC 样本出发
  2. 特征通道生成 SAR、TFD、RID 三类互补视图
  3. 运动线索用子孔径差异辅助发现疑难样本
  4. 人工复核把人工精力集中在 conflict / unsure 样本
  5. 训练导出整理为检测模型可直接消费的数据集
  6. 模型应用支撑三通道检测与级联推理验证
SAR TFD RID 融合预览
Fusion
SAR 空间强度图
SAR
TFD 时频能量图
TFD
RID 多普勒响应图
RID

Project Details

项目详情展示链接

每张卡对应一个项目,方便快速查看结果指标、代码结构和项目产物;详情页继续展开完整工程链路。

Project 01

Qwen3-VL 商品理解

10 个商品样本构造成 50 条多任务 SFT 数据,完成 baseline 推理、6 项指标评测和 Qwen-VL 微调格式转换。

  • 结果50 SFT / 6 metrics / 40-5-5 split
  • 代码data_build / preprocess / infer / eval / train
  • 验证6 个测试文件覆盖全链路
查看详情页
Project 02

VLMEvalKit 评测归因

把 MMBench 全量评测从 overall 拆到强弱类别、错误归因、SelfImage 平衡验证和可视化报告。

  • 结果4876 raw / 1292 grouped / 76.32%
  • 代码run / dataset / inference / multiple choice
  • 验证infer fail 0% / judge fail 0%
查看详情页
Project 03

FSMD-Net SAR 检测

围绕频谱建模完成 K 值消融、跨数据集迁移、复杂度分析、相位解释和 checkpoint 可视化证据。

  • 结果K=8 AP 0.572 / 跨域优于 DenoDet
  • 代码FrequencySpatialFPN / configs / work_dirs
  • 验证消融、迁移、速度和相位证据
查看详情页
Project 04

FAIR-CSAR 真实数据工程

从复数 SLC、候选筛选、三通道生成、运动线索、GUI 复核到 YOLOv8_CBAM 数据导出,形成真实数据流程。

  • 结果1406 scenes / 3508 boxes / 0 missing
  • 代码features / motion_cues / yolo_dataset / tools
  • 验证9 个测试文件 + 24 tests passed
查看详情页

Research Output

科研成果

FSMD-Net 项目提供论文级实验组织能力,也能和多模态/VLM 岗位中的视觉理解、误差分析、可解释诊断形成互补。

SCI JCR Q1 / 学生第一作者

FSMD-Net: Joint Spatial-Channel Spectral Modeling for SAR Ship Detection in Complex Inshore Scenarios

面向复杂近岸 SAR 舰船检测,设计空间-通道频谱建模方法,系统完成基准对比、消融实验、跨数据集迁移、复杂度统计与可解释可视化。

  • 复杂近岸场景下的舰船目标检测
  • 空间-通道频谱联合建模
  • 多数据集实验与审稿返修补充分析
  • 频谱、相位、激活图可视化解释

Timeline

教育与项目路径

硕士在读

北京航空航天大学 · 信息与通信工程

研究方向为计算机视觉目标检测与遥感智能解译,持续扩展到多模态/VLM 视觉评测与数据构造。

科研产出

FSMD-Net SAR 舰船检测论文

围绕复杂近岸场景完成网络设计、实验验证、可视化分析和返修材料整理。

多模态评测

VLMEvalKit 视觉能力评测闭环

跑通 MMBench 全量评测,形成 category、l2-category、错误归因和 badcase 分析主线。

VLM 工程

Qwen3-VL 电商商品理解系统

构建商品图文理解任务、SFT 数据、baseline、评测指标和 Qwen-VL 微调格式转换。

Contact

欢迎交流多模态/VLM 算法与视觉理解

邮箱 15101187760@163.com