马丁 Martin
河北 · 保定
个人信息
  • Martin / 马丁 / 男 / 1988
  • 工作年限: 13
  • 教育情况: 本科 / 教育 / 初等教育/计算机教育
  • 海外远程经验(北美、澳洲)
  • 倾向前端/全栈 · 主攻:大模型应用落地(RAG / 多模态 / Agent)、推理部署(vLLM / 量化)、在线协作、教育/医疗场景
城市
河北 · 保定
电话 / 微信
15201114387
邮箱
403028240@qq.com
技能清单
  • 开发语言: Javascript/node.jsTypescript PHP Python Ruby on rails Swift
  • 系统架构设计: 微服务架构 分布式系统 异步架构 高并发设计 分层架构 事件驱动 流式处理 性能优化
  • 大模型推理与部署: vLLM OpenAI 兼容 API GPTQ Int4 量化 Qwen2.5 / Qwen3 Qwen2.5-VL 多模态 SSE 流式 Chat GPU 显存调度 RunPod / K8s Nginx 反代 模型压测与选型
  • AI应用技术: RAG 全链路 LangChain LangGraph LlamaIndex 两段式 Chat 意图路由 Query 改写 / Facet 解析 混合检索 RRF 多模态索引(文本+图+视频帧) VLM 结构化 Caption Prompt Engineering 内容安全策略(规则+模型双轨) AI Agent
  • Embedding & 向量检索: BGE-M3 Chinese-CLIP pgvector 混合检索 (向量+BM25) RRF 融合 Cross-Encoder Rerank RAG 评测与 Trace 可观测
  • 前端: React next.js React Native Meteor Fabricjs Excalidraw React Flow Canvas/SVG Vue3jQueryApollo Clienttaro
  • ui: MuiTailwind Ant Design Element ui taro ui Vant
  • 后端框架: FastAPI Express NestJS Laravel ThinkPHP SQLAlchemy
  • 云服务 & 基础设施: AWS (S3, Lambda) 阿里云 (ECS, NLS) 腾讯云 (ECS, RDS) Supabase CloudFlare R2 Docker Docker Compose
  • 实时同步技术: YJS webSocket
  • 支付: Stripe 微信,支付宝相关接口
  • 数据库与缓存: PostgreSQL MySQL MongoDB Redis Memcache Kafka 连接池优化
  • 状态管理: zustand Redux context
  • 工具: gitcomposeryarn npm Postman
  • 项目管理: github (海外项目) coding (国内和自己的项目) jira
  • 测试工具: ones qunit jest
  • 开发IDE: cursor vscode
大模型算法项目
  • 天问 · 多模态智能检索与对话系统(重点自研 · 2025–2026) FastAPI Next.js vLLM Qwen2.5-VL BGE-M3 Chinese-CLIP RunPod GPU

    定位:面向海量多媒体内容库的生产级 RAG Demo——支持「自然语言找内容 + 多轮对话 + 检索证据可追溯」,覆盖文本元数据、封面/剧照与视频关键帧的多模态召回。

    Chat 工作流(两段式):第 1 段意图 LLM 识别「检索型 / 闲聊型」并抽取 meta_query;第 2 段按意图分流——检索型走 Hybrid RAG + 流式生成,闲聊型直连主模型;含找片信号回退、多轮 history、Playground Trace 全链路可观测(intent_ms / retrieval_query / hits)。

    检索与索引:BGE-M3 文本向量 + Chinese-CLIP 视觉向量 + BM25/标题精确匹配第四通道,RRF 融合;视频链路 ffmpeg 抽帧 → CLIP 去冗余 → VLM JSON 结构化 Caption(v2.x schema);封面/详情/关键帧分资产类型 Prompt;批量索引支持 text / text_image / full 多模式与幂等重跑。

    大模型推理与部署:生产环境基于 vLLM OpenAI 兼容 API;文本 Chat 采用 Qwen3.6 GPTQ Int4,视觉理解采用 Qwen2.5-VL-7B(文本/视觉分端口、单卡显存分时复用);完成 max-num-seqs / 并发压测与 TTFT、吞吐选型;RunPod(A6000)+ 堡垒机 K8s/Nginx 反代部署,Embedding 走 CPU、GPU 专供 LLM;含 CORS/长连接/524 等线上联调经验。

    模型策略与微调相关:参与垂直场景模型选型(GPTQ 量化 vs BF16、3B/7B VLM 效果对比);设计内容安全双轨(本地多语言规则引擎 + 模型侧策略,输入/输出双流式拦截);了解 SFT / 对齐在领域 Chat 与 Caption 中的边界,Caption Prompt 迭代至 v2.2(拼贴封面分区、马赛克 uncertain、多人主客体)。

    技术栈:Python/FastAPI, Next.js/TypeScript, SQLite/PostgreSQL+pgvector, httpx SSE, ffmpeg, vLLM, HuggingFace, Docker/Shell 运维脚本。

  • Memorix — 工业级托管多模态 RAG 平台 FastAPI Next.js PostgreSQL/pgvector BYOK 多模态 RAG

    定位:面向第三方应用与企业平台的云端 RAG 基础设施——上传即索引、API 即召回;存储/索引/检索由平台托管,LLM 生成全程 BYOK,模型费用与厂商选型完全由租户掌控。

    系统架构:索引与在线检索分离(异步 Worker 负责解析→增强→切分→向量化→可选图谱抽取;API 无状态)。多租户隔离(Project → Collection → Document),REST /v1 + 控制台 Playground 同源能力;Embedding / Chat / OCR / Rerank / VLM 五轨独立配置。

    文档理解(对标工业级 PDF RAG):版面级 Content List 解析(可选 MinerU 风格 JSON);扫描页 OCR + 图/表/公式分通道与 VLM 上下文感知增强;语义断点切分 + 10%–20% token 重叠(段落优先、固定 token 兜底);中文 PDF 跨页拼接与页眉页脚/广告/目录去噪;索引期 LLM 知识图谱实体关系抽取,检索期实体命中加分。

    检索链路优化(解决「本地 Demo 准确率高、线上用户仅 ~60%」):

    • Query 扩写 + 防幻觉:小模型生成多路同义问句并行召回;改写结果经 Embedding 余弦相似度校验(阈值 ≥0.8),低于阈值废弃,避免扩写幻觉带偏检索。
    • 混合检索:pgvector 语义召回 + Postgres 全文(BM25/FTS)+ RRF 融合,解决向量与关键词量纲不可直接相加的问题。
    • 策略路由 Rerank:简单问句走毫秒级启发式排序;复杂问句才触发租户 Cross-Encoder(~200ms/条),兼顾高并发 P99 与长难问准确率。
    • 评测闭环:Playground 与 API 返回 meta(扩写变体、图谱命中、Rerank 来源);RAG Triad 拆分 Context Recall(检索是否找对)与 Faithfulness(生成是否忠实上下文),启发式 + LLM 保守评分。

    技术栈:Python/FastAPI, SQLAlchemy, Alembic, Next.js/TypeScript, Supabase Auth/Storage, pgvector, Redis, Docker;融合 RAG-Anything 多模态管线思路并自研混合检索与租户级可观测。

    官网:https://memorix-frontend-production-5f55.up.railway.app/

  • 其他 AI 自研(HyperGPT / MathLibrary / GptService 等) LangChain OpenAI / GLM / DeepSeek ChromaDB

    早期 Chatbot、数学公式 RAG、多模型 API 聚合等实验项目;HyperGPT · 线上 Demo

工作经历
天问 · 多模态 RAG 检索对话系统 2025.8 - 至今 (核心自研)
  • 项目概述:面向大规模多媒体内容库的智能检索与对话系统,实现「语义找内容 + RAG 增强 Chat + 多模态索引」端到端落地,已在 GPU 云环境(RunPod / 堡垒机)完成生产联调。
  • Chat 架构:设计并实现两段式对话流水线——意图 LLM(find vs chat + meta_query 抽取)→ 检索 / 直聊分流;SSE 流式输出;检索证据注入与 Trace 调试面板;内容安全双轨(规则引擎 + 流式输出拦截)。
  • 检索引擎:Hybrid 召回(BGE-M3 向量 + BM25 + 标题/番号精确匹配 + Chinese-CLIP 视觉通道),RRF 融合 + 可选 Cross-Encoder Rerank;Query 改写与 Facet 结构化解析。
  • 多模态索引:文本 Chunk Embedding;封面/详情 VLM Caption;视频 ffmpeg 抽帧 → CLIP 聚类去冗余 → VLM 关键帧打标;分阶段幂等(extract / visual_only / full)。
  • LLM 部署:基于 vLLM 部署 Qwen3.6-GPTQ(Chat)与 Qwen2.5-VL-7B(视觉);完成 GPTQ 量化选型、并发压测(TTFT/吞吐/max-num-seqs);单卡 A6000 文本/视觉模型分时复用与运维脚本化。
  • 技术栈:Python/FastAPI, Next.js, vLLM, Qwen, BGE-M3, Chinese-CLIP, PostgreSQL/SQLite, pgvector, ffmpeg, RunPod, Docker
AI智能白板协作系统 (AI + Excalidraw) 2025.12 - 至今 (兼职)
  • 项目概述:基于 Excalidraw + React Flow 的无限画布协作平台,以画布 Card 为知识载体,深度集成 LLM 与 RAG,支撑「拖入资料 → 对话检索 → 可视化产出」一体化工作流。
  • 画布 Card 与多源摄入:在画布上挂载 PDF、Markdown、链接等 Card 组件,统一触发云端解析与索引;用户可在 Card 上下文中直接提问,引用定位回具体文档与页码。
  • PDF / YouTube OCR 识别:对接 OCR 与字幕/文稿抽取管线,将扫描页 PDF、YouTube 视频内容结构化为可检索文本,解决「非纯文本素材无法问答」的痛点。
  • 海量文档增强检索:单画布支持批量导入上千份资料,结合 RAGFlow / 向量知识库做 Query 扩写、混合召回与重排,在超大文档集上稳定召回高相关片段。
  • 语义意图识别:对用户自然语言做意图分类与 Query 增强(绘图指令 vs 知识问答 vs 总结提炼),路由到不同 AI 能力,降低误触发与检索跑偏。
  • 画布渲染与智能交互:Canvas/SVG 海量元素性能优化;AI 自动排版、思维导图生成、流程图智能连线等,提升协作创作效率。
  • 技术栈:React/TypeScript, Excalidraw, React Flow, Fabric.js, RAGFlow, LLM API, OCR, 向量检索, WebSocket/YJS
AI智能模拟面试系统 2025.7 - 至今 (兼职)
  • 项目概述:开发面向日本用户的AI驱动模拟面试应用,集成大语言模型、语音识别和多维度智能评估系统
  • AI对话引擎:基于GPT-4o和Deepseek构建智能面试官,实现上下文感知的多轮对话生成。设计动态Prompt工程,支持基础/高级/企业定制三种模式,通过流式响应优化用户体验和API成本
  • 多模态AI集成:集成OpenAI Whisper和阿里云NLS实现日语语音识别,开发视频分析模块提取非语言特征(面部表情、肢体动作),结合语音和视觉数据进行综合评估
  • 智能评估系统:设计6-7维度AI评估框架,使用Anthropic和GPT-4o进行结构化评估,优化LLM调用策略将多轮评估合并为单次调用,降低延迟60%以上
  • 架构优化:基于FastAPI构建异步后端,通过Redis缓存和连接池优化提升响应速度,设计分段式流程平衡实时性与资源消耗
  • 技术栈:GPT-4o, Deepseek, Anthropic Claude, OpenAI Whisper, 阿里云NLS, Python/FastAPI, SQLAlchemy, Redis, PostgreSQL, React Native, TypeScript, Prompt Engineering
心镜 · 情感健康分析平台 2025.1 - 2026.4 (自研桌面端)
  • 项目概述:面向情感咨询场景的 SaaS,基于用户聊天记录做亲密关系洞察,衔接「AI 初诊 → 深度报告 → 真人咨询」商业闭环。
  • RAG 检索:按对话事件(冲突、情感转折等)切分,构建微观/中观/宏观三层向量索引,在有限上下文内为 LLM 供给高信噪比素材。
  • 数据与产品:逆向解析微信/TXT/CSV 等聊天导出格式;结合用户画像(性格、依恋类型)做多维分析;支持多风格 AI 分析师与定制化报告。
  • 技术栈:Python/FastAPI, LangChain, LlamaIndex, GPT-4/Qwen, React/TypeScript, Swift/iOS, ChromaDB, PostgreSQL, Redis, Docker
ThirdpartAi(AI短剧自动生成系统) 2025.3 - 2025.7
  • AI 短剧生成平台前端架构;Fabric.js 无限画布剧情编排;集成 Runway/fal.ai 多模态流水线。
Stey 智能酒店项目(线上短期) 2024.10 - 2025.2
  • 担任大前端工程师,负责智能酒店项目的前端开发,利用Next.js和Tailwind CSS构建高性能的响应式网页。
  • 实现复杂的页面动态效果和流畅的用户交互体验,提升用户满意度。
  • 设计并优化支付流程,确保交易安全性与便捷性,减少用户操作步骤。
  • 与后端团队紧密协作,通过RESTful API进行数据交互,保障前后端数据一致性。
  • 参与项目架构讨论,提出多项优化建议并被采纳,有效提升开发效率和系统稳定性。
BOARDX.US (在线无限画布协作平台) 2022.3 - 2024-12
  • 核心前端架构:利用 React 和 Fabric.js 深度定制开发了高性能的在线交互式无限画布设计平台,支持海量矢量图形与富文本编辑。
  • AI智能辅助:集成大语言模型,实现了基于自然语言的智能设计辅助与图形生成功能。
  • 复杂交互与性能优化:针对 Canvas 渲染和 SVG 导出进行了深度性能优化,确保在不同设备和复杂场景下的流畅体验。
  • 使用实时同步技术如 Socket.io 与 YJS,确保多用户能够低延迟实时协作。
  • 设计和实现了RESTful API,为前端提供稳定的数据接口。
  • 使用MySQL和Redis进行数据存储和缓存,提高系统响应速度。
  • 实现了用户权限管理和数据安全机制。
保定微工坊网络科技有限公司 2012.11 - 2022.3
  • 技术负责人 / 全栈 — 主导多个 ToB/ToC 电商与社区平台(Vue3/Java、Taro、Laravel);Kafka 高并发、容器化部署、团队敏捷与质量体系;代表性项目:爱情Living 社区商城、长城系内购/福利商城、蓝梦谷校园商城、TouchHealth 健康 IoT 等。
腾讯科技(北京) 2010.10 - 2012.10
  • 担任新媒体技术支持,参与腾讯视频多个大型直播项目,保障千万级用户流畅观看体验。
  • 优化内容分发网络(CDN),有效降低视频加载延迟,提升播放成功率。
  • 与产品团队紧密配合,快速迭代功能,满足市场需求。
  • 参与内部技术沙龙,分享前沿技术动态,促进团队技术氛围。
 
冀ICP备13008594号-1