定位:面向海量多媒体内容库的生产级 RAG Demo——支持「自然语言找内容 + 多轮对话 + 检索证据可追溯」,覆盖文本元数据、封面/剧照与视频关键帧的多模态召回。
Chat 工作流(两段式):第 1 段意图 LLM 识别「检索型 / 闲聊型」并抽取 meta_query;第 2 段按意图分流——检索型走 Hybrid RAG + 流式生成,闲聊型直连主模型;含找片信号回退、多轮 history、Playground Trace 全链路可观测(intent_ms / retrieval_query / hits)。
检索与索引:BGE-M3 文本向量 + Chinese-CLIP 视觉向量 + BM25/标题精确匹配第四通道,RRF 融合;视频链路 ffmpeg 抽帧 → CLIP 去冗余 → VLM JSON 结构化 Caption(v2.x schema);封面/详情/关键帧分资产类型 Prompt;批量索引支持 text / text_image / full 多模式与幂等重跑。
大模型推理与部署:生产环境基于 vLLM OpenAI 兼容 API;文本 Chat 采用 Qwen3.6 GPTQ Int4,视觉理解采用 Qwen2.5-VL-7B(文本/视觉分端口、单卡显存分时复用);完成 max-num-seqs / 并发压测与 TTFT、吞吐选型;RunPod(A6000)+ 堡垒机 K8s/Nginx 反代部署,Embedding 走 CPU、GPU 专供 LLM;含 CORS/长连接/524 等线上联调经验。
模型策略与微调相关:参与垂直场景模型选型(GPTQ 量化 vs BF16、3B/7B VLM 效果对比);设计内容安全双轨(本地多语言规则引擎 + 模型侧策略,输入/输出双流式拦截);了解 SFT / 对齐在领域 Chat 与 Caption 中的边界,Caption Prompt 迭代至 v2.2(拼贴封面分区、马赛克 uncertain、多人主客体)。
技术栈:Python/FastAPI, Next.js/TypeScript, SQLite/PostgreSQL+pgvector, httpx SSE, ffmpeg, vLLM, HuggingFace, Docker/Shell 运维脚本。
定位:面向第三方应用与企业平台的云端 RAG 基础设施——上传即索引、API 即召回;存储/索引/检索由平台托管,LLM 生成全程 BYOK,模型费用与厂商选型完全由租户掌控。
系统架构:索引与在线检索分离(异步 Worker 负责解析→增强→切分→向量化→可选图谱抽取;API 无状态)。多租户隔离(Project → Collection → Document),REST /v1 + 控制台 Playground 同源能力;Embedding / Chat / OCR / Rerank / VLM 五轨独立配置。
文档理解(对标工业级 PDF RAG):版面级 Content List 解析(可选 MinerU 风格 JSON);扫描页 OCR + 图/表/公式分通道与 VLM 上下文感知增强;语义断点切分 + 10%–20% token 重叠(段落优先、固定 token 兜底);中文 PDF 跨页拼接与页眉页脚/广告/目录去噪;索引期 LLM 知识图谱实体关系抽取,检索期实体命中加分。
检索链路优化(解决「本地 Demo 准确率高、线上用户仅 ~60%」):
技术栈:Python/FastAPI, SQLAlchemy, Alembic, Next.js/TypeScript, Supabase Auth/Storage, pgvector, Redis, Docker;融合 RAG-Anything 多模态管线思路并自研混合检索与租户级可观测。