LiteLLM AI Gateway 生产实战:多模型路由、Fallback、预算、限流与可观测性
以稳定模型别名统一多供应商调用,落地虚拟密钥、预算、RPM/TPM、能力路由、有限重试、Fallback、隐私、指...
覆盖大模型部署、推理调优、RAG 知识库、模型微调、AI Coding、智能体与生产治理的实战文章。
以稳定模型别名统一多供应商调用,落地虚拟密钥、预算、RPM/TPM、能力路由、有限重试、Fallback、隐私、指...
从版本化黄金集、Ragas 分层指标到 OpenTelemetry GenAI 链路,建立隐私安全的离线评测、CI 门禁、在线 SLO...
用 Docling 保留 PDF、Office、扫描件、表格和图片结构,构建稳定块 ID、ACL 检索、重排、引用校验、分层评...
以发票审计 Skill 为完整示例,讲清 SKILL.md、scripts、references、assets 的职责,渐进披露、最小权限、...
基于 MCP 2026-07-28 与 TypeScript SDK v2,从工具、资源和提示模板开始,实现身份、租户隔离、幂等、人工...
构建生产级 LLM 服务的指标、追踪、容量、缓存、成本、安全、灰度、降级和故障演练体系,让质量与运行风险...
从只读工具开始构建安全 Agent:使用严格 schema、服务端鉴权、幂等键、预算限制、人工审批和审计记录隔离...
建立可审计的 AI Coding 工作流:先读项目规则和测试,限定变更范围,再生成最小补丁、验证回归、安全审查...
从是否该微调、数据清洗与隔离、LoRA/QLoRA 配置、TRL 训练,到过拟合诊断、适配器保存合并和独立验收的完...
把“幻觉”拆成可诊断的知识、检索、生成和工具错误,通过证据门禁、引用校验、拒答策略与分层评测降低风险。
从文档权限、解析与切分开始,搭建 Qdrant 向量索引、关键词与向量混合检索、重排、引用和增量更新的企业 R...
解释常用解码参数的作用与交互关系,并用固定评测集、参数网格和结构化记录完成可复现调优,避免凭感觉改参...