2024 · 已完成
行业多模态平台
平台子能力研发
面向复杂行业场景,交付多语种文档解析、语音识别、视觉向量检索与 LLM 文本理解等可复用平台能力。
OCR / DocVQAWhisper + LoRACTranslate2CLIP / ResNetMilvusLLM 分类FastAPI
以下为作者提供的脱敏项目记录,结果尚未经独立复核。
项目背景
面向需要处理多语种文档、音视频与图像资料的行业用户,统一提供文档解析、内容检索、语音转写和文本理解能力,以提升信息处理效率与可访问性。
方案与系统链路
- 文档侧:多 OCR 引擎路由 → 语种识别与版面还原 → 结构化抽取 / DocVQA。
- 语音侧:Whisper large-v3 → LoRA 小语种与行业术语适配 → 流式分段与端点检测 → 服务化推理。
- 视觉侧:ResNetV2-50 / CLIP 特征提取 → Milvus GPU 索引 → 倒排与向量混合检索。
- 应用侧:Qwen / GPT Prompt-based 分类 → FastAPI 服务封装 → 容器化、灰度发布、监控与异常降级。
我的负责范围
- 整合 PP-OCR、EasyOCR 与 MinerU,构建多语种 OCR 路由、版面还原、结构化抽取与 DocVQA 能力。
- 使用 Whisper large-v3 与 LoRA 完成小语种、行业术语适配,并实现流式分段与端点检测的服务化部署。
- 基于 ResNetV2-50 / CLIP 提取视觉特征并接入 Milvus,支持以图搜图、文字搜图及文档封面等视觉检索场景。
- 探索以 Qwen / GPT 为核心的 Prompt-based 文本分类,支持无标签冷启动场景;完成容器化、灰度发布、监控与异常降级。
可公开结果
- 统一多语种识别与版面还原后,结构化字段准确率提升 9.8%。
- 小语种 ASR 服务端到端 P95 降低 28%,QPS 提升 1.4×。
- 千万级视觉向量检索 P99 小于 120ms,并通过倒排与向量混检降低误召。