跳转到正文
返回关于

文化服务智能客服

项目 Owner / 全流程开发

独立负责 ASR、RAG/Agent、LLM 与 TTS 的智能客服闭环,并完成话务接入、模型服务、评测与数据生产工具建设。

Whisper + LoRARAG / AgentLlamaIndexMilvusQwen / ChatGLM3D-Speaker + VADFreeSWITCHEdge-TTS / VITS

以下为作者提供的脱敏项目记录,结果尚未经独立复核。

项目背景

面向文化服务场景的高频咨询,建设替代部分人工坐席的智能语音问答系统。系统需支持从电话语音输入到语音回复的完整闭环,并为知识更新、模型迭代和服务质量评估提供数据基础。

方案与系统链路

  1. 话务接入:FreeSWITCH → WebSocket 流式传输 → ASR 转写与 VAD 分段。
  2. 问答决策:意图识别 → LlamaIndex / Milvus 检索与工具路由 → Qwen / ChatGLM 生成回复。
  3. 语音反馈:Edge-TTS / VITS 合成 → 话务系统返回;3D-Speaker 支持身份核验与多说话人处理。
  4. 质量闭环:链路追踪与回放 → ASR / QA 标注平台 → 训练数据、实验配置与 Prompt 版本管理。

我的负责范围

  • 基于 LlamaIndex 与 Milvus 构建知识库检索、工具路由与多轮问答,设计 System Prompt 与 Few-shot 模板,并建立召回率、覆盖率与幻觉率评测。
  • 完成 Whisper large-v2 LoRA 领域微调、CTranslate2 INT8 推理优化,以及 ChatGLM LoRA 意图识别和 Qwen 服务部署。
  • 使用 3D-Speaker 与 VAD 实现自动分段、多说话人分离、身份核验与黑名单能力;结合 Edge-TTS 和 VITS 支持语音反馈与音色迁移。
  • 对接 FreeSWITCH,打通 WebSocket 流式 ASR → RAG/Agent → LLM → TTS 链路;建设链路追踪、回放、ASR/QA 标注与 Prompt 版本管理工具。

可公开结果

  • RAG 检索召回@20 提升 12%,幻觉率降低 18%。
  • Whisper 领域识别准确率从 87% 提升至 93%;推理 P95 降低 37%,显存降低 30%,吞吐提升 1.6×。
  • 多说话人混叠场景误检降低 22%,语音合成 MOS 盲测提升 0.3。
  • 端到端服务峰值 QPS 达 120,P99 为 850ms。

关联公开内容