跳转到正文
返回关于

行业多模态平台

平台子能力研发

面向复杂行业场景,交付多语种文档解析、语音识别、视觉向量检索与 LLM 文本理解等可复用平台能力。

OCR / DocVQAWhisper + LoRACTranslate2CLIP / ResNetMilvusLLM 分类FastAPI

以下为作者提供的脱敏项目记录,结果尚未经独立复核。

项目背景

面向需要处理多语种文档、音视频与图像资料的行业用户,统一提供文档解析、内容检索、语音转写和文本理解能力,以提升信息处理效率与可访问性。

方案与系统链路

  1. 文档侧:多 OCR 引擎路由 → 语种识别与版面还原 → 结构化抽取 / DocVQA。
  2. 语音侧:Whisper large-v3 → LoRA 小语种与行业术语适配 → 流式分段与端点检测 → 服务化推理。
  3. 视觉侧:ResNetV2-50 / CLIP 特征提取 → Milvus GPU 索引 → 倒排与向量混合检索。
  4. 应用侧:Qwen / GPT Prompt-based 分类 → FastAPI 服务封装 → 容器化、灰度发布、监控与异常降级。

我的负责范围

  • 整合 PP-OCR、EasyOCR 与 MinerU,构建多语种 OCR 路由、版面还原、结构化抽取与 DocVQA 能力。
  • 使用 Whisper large-v3 与 LoRA 完成小语种、行业术语适配,并实现流式分段与端点检测的服务化部署。
  • 基于 ResNetV2-50 / CLIP 提取视觉特征并接入 Milvus,支持以图搜图、文字搜图及文档封面等视觉检索场景。
  • 探索以 Qwen / GPT 为核心的 Prompt-based 文本分类,支持无标签冷启动场景;完成容器化、灰度发布、监控与异常降级。

可公开结果

  • 统一多语种识别与版面还原后,结构化字段准确率提升 9.8%。
  • 小语种 ASR 服务端到端 P95 降低 28%,QPS 提升 1.4×。
  • 千万级视觉向量检索 P99 小于 120ms,并通过倒排与向量混检降低误召。

关联公开内容