AI Gateway:从后端调度到成本治理
通过多后端模型访问场景,理解 AI Gateway 如何处理资源调度、容量控制、故障切换、分布式状态、用量统计和企业成本治理。
短文
约 23 分钟阅读
收录于专栏 技术规划与架构 · 第 9 篇
标签
围绕“可观测性”的写作、研究、项目与影像。
通过多后端模型访问场景,理解 AI Gateway 如何处理资源调度、容量控制、故障切换、分布式状态、用量统计和企业成本治理。
短文
约 23 分钟阅读
收录于专栏 技术规划与架构 · 第 9 篇
以一套多层执行服务为例,拆解请求身份、边缘路由、执行资源和后端缓存的多级局部性,并给出可复用的路由、失效、故障转移与观测方案。
短文
约 15 分钟阅读
收录于专栏 技术规划与架构 · 第 7 篇
从一套多节点执行系统的故障结构出发,复盘请求、状态、存储、性能和故障如何逐渐跨越边界,并讨论下一版架构应该怎样重新组织。
短文
约 30 分钟阅读
收录于专栏 技术规划与架构 · 第 6 篇
从分析、经营和工程的不同问题出发,整理一个多来源业务平台的数据中心应该如何划分 Tab、定义指标、组织读写链路,以及怎样处理计费、对账、增长和成本。
短文
约 37 分钟阅读
从裂变奖励和交易系统出发,设计一套可复用、可审计的营销基础设施,覆盖活动、受众、权益、预算、归因、风控、实验、触达和效果分析。
案例
约 21 分钟阅读
从一次多系统对接经历出发,区分创造、任务效率、组织生产力和经营价值,讨论 AI 进入复杂系统后,收益到底从哪里来、成本又该怎么算。
短文
约 9 分钟阅读
收录于专栏 工程与 AI 判断 · 第 10 篇
从一个小型 API 服务的观测问题出发,借鉴成熟可观测平台的经验,整理 Request ID、分布式 Trace、服务发现、健康监测、日志查询、稳定性和基础设施治理的最小实现。
案例
约 25 分钟阅读
从候选链、失败分类、per-turn identity 到成本公式,解释一个可控、可审计的 DSH 多来源模型路由器如何工作。
查看项目提交成功、抓取成功、索引成功和排名回升是四件不同的事;把它们混成一句"收录了",流量事故就没法排查。
案例
约 5 分钟阅读
收录于专栏 搜索引擎增长工程 · 第 4 篇
被 AI 提到、被引用、引用内容真正支持答案,是三件不同的事;这里用一套证据状态机取代一个神秘的可见性分数。
案例
约 10 分钟阅读
收录于专栏 搜索引擎增长工程 · 第 9 篇
从长任务中的实际使用出发,讨论 Agent 如何依据不确定性、等待、失败和接管需求调节状态、证据与行动反馈;也记录执行委托如何改变人的压力、信任和能力边界。
约 28 分钟阅读
阅读摘要从 ChatLab 的实际设计出发,记录如何借用人和人协作中的在场、回应、等待和交付语法,让 Agent 的运行状态更容易被理解;这是一篇关于反馈、证据、关键介入和结果确认的 HCI 设计观察。
约 26 分钟阅读
阅读摘要讨论任务开始阶段的拆解、子任务能力分类、模型选择与执行中切换,并将完整 Agent 调度理论收缩为 dsh-quota-router 的一个工程切片:已拆分子任务的模型能力路由与有界 fallback。
约 38 分钟阅读
阅读摘要DeepSeek Harness 的纯策略插件:按任务选择有序、可解释、可审计的模型候选链,并在配额、限流或传输失败时沿链有界前进。
查看项目一份可公开复用的指标词典:从请求、用户到任务,说明可用性、错误、延迟、性能和反馈数据该怎样定义、组合和解读。
短文
约 19 分钟阅读
收录于专栏 数据度量工作指南 · 第 2 篇