跳转到正文

关于

多模态 / 视频模型工程师

让复杂的 AI,成为可靠、自然的产品体验。

我专注于多模态、视频和 LLM 系统工程。从模型能力、评测数据到服务链路,持续把可行的技术方案推进为可用的业务系统。

MultimodalVideoLLM SystemsModel Engineering
AI 工程师的自我介绍插画

01

方向判断

从真实问题出发,找到值得长期投入的路径。

02

系统落地

让模型、数据与产品在同一套交付链路里协同。

03

持续迭代

用评测和反馈驱动每一次可验证的改进。

多模态 / 视频模型工程师

01

多模态与视频

视频理解与生成、文档解析、OCR / DocVQA 与视觉检索。

02

LLM 与生成质量

RAG / Agent、奖励模型、候选排序、评估与数据闭环。

03

模型服务与平台

ASR Serving、模型适配、资源管理与可观测性。

职业经历归档

以下内容聚焦可公开的职责、方法与结果;业务名称和实现细节已按保密要求做抽象处理。

  1. 2026探索中

    视频创作 Agent

    Agent 工作流设计与开发

    探索从创意澄清到分镜视频生成的可控、人机协作式创作工作流。

    查看职责摘要
    • 拆解创意确认、剧本生成、资产规划与分镜视频生成之间的任务依赖。
    • 设计由 Agent 协调的自由创作流程,为后续人工确认和局部重做保留控制点。
    查看项目
  2. 2026开发中

    视频重绘流水线

    生成式视频流程开发

    将既有视频资产拆解为镜头级的可编辑生产流程,并重建为新的成片。

    查看职责摘要
    • 设计从视频资产库解析、分镜脚本生成到资产图与分镜视频生成的端到端链路。
    • 组织镜头级资产与最终合成之间的中间产物,使流程便于持续调试与迭代。
    查看项目
  3. 2025持续迭代

    多语言翻译质量系统

    翻译三阶段 Agent、剧名 RM / RL 与质量闭环建设

    围绕剧名与视频字幕翻译,建设从生成、诊断、定向修复到人工反馈和训练数据回流的多语言质量系统。

    查看职责摘要
    • 在既有字幕初译链路中引入“初译—反思—改进”三阶段 Agent:由反思阶段定位错译、漏译、术语、字幕错位、CPS 和语区表达问题,再由改进阶段只修复问题行。
    • 设计剧名多候选生成、硬性质量过滤、LLM 多维度打分和加权选择流程;使用人工偏好与实际采用数据构建奖励模型,并将奖励信号用于 RL 迭代候选生成和排序。
    • 建设主动反馈与数据回流流程,关联译员问题、最终人工版本、实际采用剧名、语种、模型和策略版本,将生产反馈整理为评估、训练及回归样本。
    • 建立剧名采用率、字幕单行修改率、整集无修改率与严重错误分类等指标,按语种持续比较 Agent、Prompt、规则、RM 和 RL 版本的效果。
    查看项目
  4. 2025已完成

    ASR 性能优化与统一 AI 中台

    ASR 服务优化、评测建设与 AI 中台开发

    围绕语音识别服务的处理速度与并发能力,完成多进程推理和数据传输优化;收集中英文、四川方言及业务音频,搭建模型接口评测流程,并通过统一 AI 中台承接业务接入。

    查看职责摘要
    • 负责 ASR 推理服务的加速与并发优化,调整锁粒度、多进程 Worker、共享内存传输和多设备模型调度,并通过压测验证方案。
    • 收集中文三个开源数据集、英文三个开源数据集、四川方言数据和实际业务音频,完成人工标注,并搭建调用不同 ASR 模型接口的效果评测程序。
    • 建设统一 AI 中台,提供模型与 Agent 接入、知识库检索、API Key 鉴权、业务配置和用量管理,打通异步语音转写与结果回调。
    查看项目
  5. 2024已完成

    行业多模态平台

    平台子能力研发

    面向复杂行业场景,交付多语种文档解析、语音识别、视觉向量检索与 LLM 文本理解等可复用平台能力。

    查看职责摘要
    • 整合 PP-OCR、EasyOCR 与 MinerU,构建多语种 OCR 路由、版面还原、结构化抽取与 DocVQA 能力。
    • 使用 Whisper large-v3 与 LoRA 完成小语种、行业术语适配,并实现流式分段与端点检测的服务化部署。
    • 基于 ResNetV2-50 / CLIP 提取视觉特征并接入 Milvus,支持以图搜图、文字搜图及文档封面等视觉检索场景。
    • 探索以 Qwen / GPT 为核心的 Prompt-based 文本分类,支持无标签冷启动场景;完成容器化、灰度发布、监控与异常降级。
    查看项目
  6. 2023已完成

    文化服务智能客服

    项目 Owner / 全流程开发

    独立负责 ASR、RAG/Agent、LLM 与 TTS 的智能客服闭环,并完成话务接入、模型服务、评测与数据生产工具建设。

    查看职责摘要
    • 基于 LlamaIndex 与 Milvus 构建知识库检索、工具路由与多轮问答,设计 System Prompt 与 Few-shot 模板,并建立召回率、覆盖率与幻觉率评测。
    • 完成 Whisper large-v2 LoRA 领域微调、CTranslate2 INT8 推理优化,以及 ChatGLM LoRA 意图识别和 Qwen 服务部署。
    • 使用 3D-Speaker 与 VAD 实现自动分段、多说话人分离、身份核验与黑名单能力;结合 Edge-TTS 和 VITS 支持语音反馈与音色迁移。
    • 对接 FreeSWITCH,打通 WebSocket 流式 ASR → RAG/Agent → LLM → TTS 链路;建设链路追踪、回放、ASR/QA 标注与 Prompt 版本管理工具。
    查看项目