Multimodal / VLM / Computer Vision
你好,我是沈奕江
北京航空航天大学信息与通信工程硕士在读,求职方向为多模态/VLM 算法。我的项目重点放在数据构造、模型推理、评测归因、科研实验和工程复现。
Multimodal / VLM / Computer Vision
北京航空航天大学信息与通信工程硕士在读,求职方向为多模态/VLM 算法。我的项目重点放在数据构造、模型推理、评测归因、科研实验和工程复现。
Resources
About
MMBench grouped accuracy
VLMEvalKit
Service 01
从样本、脚本、指标到图表,把算法项目组织成可以追溯的闭环。
Capability Map
页面重点不再只罗列经历,而是把每项能力落到项目证据、代码模块、实验结果和可复现产物上。
围绕商品属性、视觉证据、风险识别、卖点生成和 Agent 动作构建多任务 SFT 样本。
证据:10 products / 50 SFT / Qwen-VL 格式转换从模型接入、prompt 构造、批量推理、exact matching 到 category 与 badcase 分析。
证据:MMBench 4876 raw rows / 76.32%围绕 SAR 舰船检测做频谱建模、消融实验、跨数据集迁移和相位可解释分析。
证据:FSMD-Net / AP 0.572 / 跨域提升保留配置、脚本、日志、测试与结果文件,让项目可被追溯、复跑和面试深挖。
证据:测试覆盖 / 训练脚本 / 指标 JSONFeatured Projects
整体内容按 STAR 法则组织:先说明项目情境与目标,再讲我的行动组织方式,最后用结果指标和复盘结论证明项目价值。
围绕电商商品图文理解场景,搭建一套可汇报、可复盘的多模态任务闭环,用小样本验证数据组织、任务拆解、推理评估和后续微调准备能力。
电商商品理解需要同时处理图片、标题、OCR、描述和类目信息,单一属性抽取难以覆盖真实运营场景。
把任务拆成属性识别、视觉证据、风险判断、卖点生成和运营动作建议,形成可训练、可评估的数据闭环。
按数据层、任务层、执行层、评估层组织工程结构,并保留 LoRA/QLoRA 与 Qwen-VL 格式的后续扩展入口。
完成 10 个商品样本到 50 条多任务样本的闭环验证,输出 6 类评估指标和可展示的样例结果。
{
"task": "visual_evidence",
"category": "鞋靴/休闲鞋",
"evidence": [
{"attribute": "color", "value": "灰色", "source": "image"},
{"attribute": "material", "value": "针织织面", "source": "image"}
]
}
当前项目定位是小样本闭环验证,重点证明我能把业务场景拆成可训练任务、可评估指标和可扩展工程结构;真实 Qwen3-VL 推理与 LoRA 训练可作为下一阶段里程碑继续推进。
围绕多模态模型评测岗位需求,搭建从 benchmark 跑分到错误归因的分析闭环,把一次模型评测沉淀为能指导数据、prompt 和模型迭代的诊断报告。
多模态模型评测不能只看 overall 分数,招聘和业务更关心模型在哪些视觉能力上强、哪些环节会失败。
构建可复现的评测流程,并把 MMBench 结果拆解到类别、能力短板、混淆矩阵和代表 badcase。
按模型接入、数据集管理、批量推理、答案解析、指标汇总、错误归因六层组织评测工程。
完成 4876 条原始预测与 1292 个分组样本分析,得到 76.32% overall,并定位空间、物理推理等弱项。
结论:消除答案位置全 A 偏置后,模型仍在 10 个自建单选样本上全部命中,说明结果不是由选项位置投机得到。
结论:预测分布与去偏置后的标准答案一致,后续报告可把该实验作为“数据接入、判题规则、可视化链路均可用”的小样本验证。
围绕复杂近岸 SAR 舰船检测中的小目标、强杂波和域迁移问题,完成从方法设计、实验验证到审稿补充分析的科研闭环。
复杂近岸 SAR 场景中,船舶目标易受岸线、港口结构和相干斑影响,传统视觉特征难以稳定区分目标与背景。
设计更适合 SAR 图像的频谱建模方案,并通过消融、跨数据集和复杂度分析证明方法有效性。
围绕空间-通道频谱建模组织实验,补充 K 值、跨域、显著性、速度与可解释可视化等证据。
K=8 时 AP 达 0.572,跨数据集迁移优于 DenoDet,并以较小参数开销支撑论文和返修材料。
| K | AP | AP50 | AP75 | APs |
|---|---|---|---|---|
| 1 | 0.566 | 0.798 | 0.631 | 0.569 |
| 4 | 0.565 | 0.802 | 0.622 | 0.569 |
| 8 | 0.572 | 0.808 | 0.638 | 0.575 |
| 16 | 0.569 | 0.803 | 0.631 | 0.571 |
| Transfer | FSMD-Net | DenoDet | Gain |
|---|---|---|---|
| SARDet -> HRSID | 0.5315 | 0.5198 | +0.0117 |
| SARDet -> AIR-SARShip-2.0 | 0.4310 | 0.3958 | +0.0351 |
面向真实散焦舰船检测数据不足的问题,搭建从复数 SLC 数据、运动线索生成、半自动标注到三通道检测训练的数据工程流程。
真实 SAR 散焦舰船样本标注成本高,且静止/运动目标需要结合时频和多普勒线索才能更可靠地区分。
建立半自动数据生产流程,减少纯人工筛选压力,并输出可直接用于检测模型训练的数据格式。
按候选筛选、三通道生成、运动线索、GUI 复核、YOLO 导出、训练推理六个环节组织工程。
形成 1406 个 ready scenes、3508 个候选框,缺失资产为 0,为后续真实数据训练提供基础。




Project Details
每张卡对应一个项目,方便快速查看结果指标、代码结构和项目产物;详情页继续展开完整工程链路。
10 个商品样本构造成 50 条多任务 SFT 数据,完成 baseline 推理、6 项指标评测和 Qwen-VL 微调格式转换。
把 MMBench 全量评测从 overall 拆到强弱类别、错误归因、SelfImage 平衡验证和可视化报告。
围绕频谱建模完成 K 值消融、跨数据集迁移、复杂度分析、相位解释和 checkpoint 可视化证据。
从复数 SLC、候选筛选、三通道生成、运动线索、GUI 复核到 YOLOv8_CBAM 数据导出,形成真实数据流程。
Research Output
FSMD-Net 项目提供论文级实验组织能力,也能和多模态/VLM 岗位中的视觉理解、误差分析、可解释诊断形成互补。
面向复杂近岸 SAR 舰船检测,设计空间-通道频谱建模方法,系统完成基准对比、消融实验、跨数据集迁移、复杂度统计与可解释可视化。
Timeline
研究方向为计算机视觉目标检测与遥感智能解译,持续扩展到多模态/VLM 视觉评测与数据构造。
围绕复杂近岸场景完成网络设计、实验验证、可视化分析和返修材料整理。
跑通 MMBench 全量评测,形成 category、l2-category、错误归因和 badcase 分析主线。
构建商品图文理解任务、SFT 数据、baseline、评测指标和 Qwen-VL 微调格式转换。
Contact