其他
运维
转型
推荐课程
average > 0 ? $model->average . '分' : '10.0分' ?>

平台运维架构治理与运维体系建设实务

前小红书 运维团队负责人

钱老师拥有11年互联网公司运维团队管理经验,2年大数据运维及8年运维研发经验。熟悉云计算平台、云原生架构、运维架构,具备运维体系的相关工作经验,擅长云原生、工程平台的实战及培训。作为资深运维管理实战专家,同时为多家互联网公司提供工程平台一体化解决方案的规划及技术培训服务。
在巨人网络公司任职8年,作为系统运维步入职场,经历了“征途”系列游戏运维平台的研发及游戏大数据平台的建设工作。曾任巨人网络平台部运维主管,负责游戏的运维平台开发工作,任职期间“征途”游戏注册用户突破 2 亿,同时在线人数突破 100 万,开创了万人国战的PK风潮。后任大数据平台项目经理,带领团队完成巨人网络第一套游戏大数据平台的落地及运营。
曾就职小红书,是技术团队第17号员工,任运维团队负责人。建立运维体系,管理系统运维、业务运维、运维研发、运维安全及DBA团队,发展电商平台运维架构,保障电商平台架构的稳定及迭代,期间注册用户突破2000万,成为国内内容电商的领头羊。后由于公司战略需要,以项目经理的角色,组织整个技术团队将全站系统从阿里云整体平滑迁移至腾讯云。
曾就职上海乐言信息科技基础技术服务部副总经理,确保公司“智能客服机器人”产品顺利承载阿里系智能客服的大促洪泛访问。设计云计算资源成本核算模型,改造云原生工程平台,集成智能测试框架,打通项目管理与审批流,引入服务网格技术,创建AI大模型实验室,帮助公司在智能客服领域建立相对技术高地。任职期间,公司已成为阿里系智能客服业务的最大服务商,承载阿里系超过70%的智能客服业务。

钱老师拥有11年互联网公司运维团队管理经验,2年大数据运维及8年运维研发经验。熟悉云计算平台、云原生架构、运维架构,具备运维体系的相关工作经验,擅长云原生、工程平台的实战及培训。作为资深运维管理实战专家,同时为多家互联网公司提供工程平台一体化解决方案的规划及技术培训服务。 在巨人网络公司任职8年,作为系统运维步入职场,经历了“征途”系列游戏运维平台的研发及游戏大数据平台的建设工作。曾任巨人网络平台部运维主管,负责游戏的运维平台开发工作,任职期间“征途”游戏注册用户突破 2 亿,同时在线人数突破 100 万,开创了万人国战的PK风潮。后任大数据平台项目经理,带领团队完成巨人网络第一套游戏大数据平台的落地及运营。 曾就职小红书,是技术团队第17号员工,任运维团队负责人。建立运维体系,管理系统运维、业务运维、运维研发、运维安全及DBA团队,发展电商平台运维架构,保障电商平台架构的稳定及迭代,期间注册用户突破2000万,成为国内内容电商的领头羊。后由于公司战略需要,以项目经理的角色,组织整个技术团队将全站系统从阿里云整体平滑迁移至腾讯云。 曾就职上海乐言信息科技基础技术服务部副总经理,确保公司“智能客服机器人”产品顺利承载阿里系智能客服的大促洪泛访问。设计云计算资源成本核算模型,改造云原生工程平台,集成智能测试框架,打通项目管理与审批流,引入服务网格技术,创建AI大模型实验室,帮助公司在智能客服领域建立相对技术高地。任职期间,公司已成为阿里系智能客服业务的最大服务商,承载阿里系超过70%的智能客服业务。

课程费用

6800.00 /人

课程时长

1

成为教练

课程简介

1、平台运维角色的演进趋势:从“系统维护”向“平台治理”转型;运维岗位能力边界的持续外延
2、云化背景下的复杂性挑战:多云与混合云带来的运维复杂度提升;资源规模扩张与管理难度非线性增长
3、成本与效率的双重压力:云资源使用粗放导致成本不可控;运维效率与业务响应速度之间的矛盾
4、服务化与流程化能力缺口:运维流程碎片化问题突出;服务管理机制缺失带来的系统性风险

目标收益

1、平台运维能力的结构拆解
• 运维能力的三层模型:架构 / 成本 / 服务
• 不同能力之间的依赖关系与作用边界
2、一体化治理的核心路径设计
• 从单点优化走向系统治理的演进路径
• 架构规划、FinOps与ITSM的协同逻辑
3、能力跃迁的关键转折点
• 从“执行导向”到“决策支持”
• 从“工具驱动”到“体系驱动”

培训对象

平台运维工程师 / 云运维工程师 / 运维负责人

课程大纲

模块一:平台运维架构与工程能力一体化构建 1、运维驱动的架构设计参与机制
• 运维从“后置支撑”转向“前置设计”的角色升级
• 架构设计中的运维约束嵌入(稳定性、可运维性、可观测性)
• 运维与研发在架构阶段的协同方式与决策边界
2、云架构设计的关键策略与实现路径
• 高可用架构设计与容灾体系构建逻辑
• 弹性架构与资源调度策略(自动扩缩容、负载均衡机制)
• 公有云、私有云与混合云架构设计的差异化策略
3、运维工程化能力体系建设
• 自动化能力从工具化向流程化的演进路径
• 标准化、规范化与配置管理体系的构建方式
• 运维工程化的核心能力模型(部署、监控、故障响应)
4、平台化运维能力与稳定性优化机制
• 从脚本化运维到平台化运维的能力跃迁路径
• 运维平台的核心功能结构(监控、调度、自动化执行)
• 故障处理流程优化与系统稳定性提升策略
模块二:云成本治理与FinOps实施路径 1、运维视角下的成本问题重构
• 云资源成本结构解析(计算、存储、网络等)
• 成本失控的典型原因(资源浪费、架构不合理、使用习惯问题)
• 运维行为对成本的直接与间接影响机制
2、FinOps体系的构建与落地路径
• 成本可视化与数据驱动分析方法
• 成本归因与分摊机制设计(团队 / 项目 / 业务维度)
• FinOps在组织中的角色与协同模式
3、成本优化与资源效率提升策略
• 常见成本优化手段(资源调度、规格优化、生命周期管理)
• 成本与性能、稳定性之间的权衡逻辑
• 持续成本治理的闭环机制(监控—分析—优化—反馈)
模块三:ITSM服务体系与运维管理机制建设 1、服务化运维的体系结构设计
• ITSM整体框架与核心流程(事件、问题、变更、发布)
• 从“技术运维”到“服务运维”的转型逻辑
• 服务目录与服务边界的定义方式
2、关键流程的工程化落地方式
• 事件与问题管理的闭环机制设计
• 变更管理与发布控制的风险控制策略
• 运维流程标准化与流程治理方法
3、服务质量与组织协同机制
• SLA设计与服务质量评估方法
• 运维团队与业务、研发团队的协同模型
• 服务管理在组织中的推广与落地路径
模块四:典型场景驱动的运维治理与能力落地 1、多云与复杂环境下的治理实践
• 跨云资源统一管理与调度问题
• 成本治理与运维体系协同的实践路径
2、高负载与高复杂业务场景应对
• 高并发系统的稳定性保障策略
• 弹性扩展与容量规划方法
3、流程与体系混乱场景的优化路径
• 运维流程梳理与重构方法
• ITSM体系从0到1的落地步骤
4、平台运维能力的落地与持续演进
• 架构、成本、服务三位一体治理模型回顾
• 能力落地的阶段划分(初期 / 优化 / 扩展)
• 组织级推广与持续改进机制
五、相关案例 案例一:多云架构下的稳定性与运维协同失效问题
背景:某互联网平台业务快速扩张,采用公有云 + 私有云混合架构,服务数量超过300+,部署在多个区域。
核心问题:
• 架构设计由研发主导,运维未参与设计阶段
• 服务之间依赖复杂,但缺乏统一的可观测与依赖管理机制
• 故障发生时:
• 定位时间长(MTTR高)
• 跨团队沟通成本极高
案例二:云资源成本失控与FinOps缺失
背景:某企业全面上云3年后,云成本快速增长,但业务增长并未同步提升。
核心问题:
• 资源使用粗放:
• 大量闲置实例
• 过度配置(over-provisioning)
• 成本归属不清:
• 无法分摊到具体业务或团队
• 运维缺乏成本意识:
• 优先保证稳定,不关注成本
案例三:运维流程混乱导致服务质量下降
背景:某传统企业IT系统逐步互联网化,但运维仍停留在“人驱动”阶段。
核心问题:
• 故障处理无统一流程:
• 每次处理方式不同
• 变更频繁但缺乏控制:
• 变更引发故障占比高
• 服务质量不可衡量:
• 无SLA体系
案例四:高并发场景下的稳定性与成本失衡
背景:某电商平台在大促期间(如双11),系统负载激增10倍以上。
核心问题:
• 为保证稳定性,大量预留资源:
• 成本极高
• 弹性能力不足:
• 无法精准扩缩容
• 运维与成本目标冲突:
• 稳定 vs 成本
模块一:平台运维架构与工程能力一体化构建
1、运维驱动的架构设计参与机制
• 运维从“后置支撑”转向“前置设计”的角色升级
• 架构设计中的运维约束嵌入(稳定性、可运维性、可观测性)
• 运维与研发在架构阶段的协同方式与决策边界
2、云架构设计的关键策略与实现路径
• 高可用架构设计与容灾体系构建逻辑
• 弹性架构与资源调度策略(自动扩缩容、负载均衡机制)
• 公有云、私有云与混合云架构设计的差异化策略
3、运维工程化能力体系建设
• 自动化能力从工具化向流程化的演进路径
• 标准化、规范化与配置管理体系的构建方式
• 运维工程化的核心能力模型(部署、监控、故障响应)
4、平台化运维能力与稳定性优化机制
• 从脚本化运维到平台化运维的能力跃迁路径
• 运维平台的核心功能结构(监控、调度、自动化执行)
• 故障处理流程优化与系统稳定性提升策略
模块二:云成本治理与FinOps实施路径
1、运维视角下的成本问题重构
• 云资源成本结构解析(计算、存储、网络等)
• 成本失控的典型原因(资源浪费、架构不合理、使用习惯问题)
• 运维行为对成本的直接与间接影响机制
2、FinOps体系的构建与落地路径
• 成本可视化与数据驱动分析方法
• 成本归因与分摊机制设计(团队 / 项目 / 业务维度)
• FinOps在组织中的角色与协同模式
3、成本优化与资源效率提升策略
• 常见成本优化手段(资源调度、规格优化、生命周期管理)
• 成本与性能、稳定性之间的权衡逻辑
• 持续成本治理的闭环机制(监控—分析—优化—反馈)
模块三:ITSM服务体系与运维管理机制建设
1、服务化运维的体系结构设计
• ITSM整体框架与核心流程(事件、问题、变更、发布)
• 从“技术运维”到“服务运维”的转型逻辑
• 服务目录与服务边界的定义方式
2、关键流程的工程化落地方式
• 事件与问题管理的闭环机制设计
• 变更管理与发布控制的风险控制策略
• 运维流程标准化与流程治理方法
3、服务质量与组织协同机制
• SLA设计与服务质量评估方法
• 运维团队与业务、研发团队的协同模型
• 服务管理在组织中的推广与落地路径
模块四:典型场景驱动的运维治理与能力落地
1、多云与复杂环境下的治理实践
• 跨云资源统一管理与调度问题
• 成本治理与运维体系协同的实践路径
2、高负载与高复杂业务场景应对
• 高并发系统的稳定性保障策略
• 弹性扩展与容量规划方法
3、流程与体系混乱场景的优化路径
• 运维流程梳理与重构方法
• ITSM体系从0到1的落地步骤
4、平台运维能力的落地与持续演进
• 架构、成本、服务三位一体治理模型回顾
• 能力落地的阶段划分(初期 / 优化 / 扩展)
• 组织级推广与持续改进机制
五、相关案例
案例一:多云架构下的稳定性与运维协同失效问题
背景:某互联网平台业务快速扩张,采用公有云 + 私有云混合架构,服务数量超过300+,部署在多个区域。
核心问题:
• 架构设计由研发主导,运维未参与设计阶段
• 服务之间依赖复杂,但缺乏统一的可观测与依赖管理机制
• 故障发生时:
• 定位时间长(MTTR高)
• 跨团队沟通成本极高
案例二:云资源成本失控与FinOps缺失
背景:某企业全面上云3年后,云成本快速增长,但业务增长并未同步提升。
核心问题:
• 资源使用粗放:
• 大量闲置实例
• 过度配置(over-provisioning)
• 成本归属不清:
• 无法分摊到具体业务或团队
• 运维缺乏成本意识:
• 优先保证稳定,不关注成本
案例三:运维流程混乱导致服务质量下降
背景:某传统企业IT系统逐步互联网化,但运维仍停留在“人驱动”阶段。
核心问题:
• 故障处理无统一流程:
• 每次处理方式不同
• 变更频繁但缺乏控制:
• 变更引发故障占比高
• 服务质量不可衡量:
• 无SLA体系
案例四:高并发场景下的稳定性与成本失衡
背景:某电商平台在大促期间(如双11),系统负载激增10倍以上。
核心问题:
• 为保证稳定性,大量预留资源:
• 成本极高
• 弹性能力不足:
• 无法精准扩缩容
• 运维与成本目标冲突:
• 稳定 vs 成本

课程费用

6800.00 /人

课程时长

1

预约体验票 我要分享

近期公开课推荐

近期公开课推荐

提交需求