运维工程师简历
本文在早前的批量搬迁中发生字符丢失,已按上下文逐处还原;其中「期望薪资」「0→1」等少数数字为推断值,请自行核对。
Kubernetes / AIGC 平台运维工程师(3年以上|云GPU / AI 推理方向)
📧 2467802439@qq.com | 📱 15539512550
💰 期望薪资10K-15K(可根据岗位匹配度调整)
技术站点 / 项目
- https://k8syun.com 个人技术站点,沉淀 Linux / Kubernetes / CI/CD / 云原生与运维实践经验
- https://free-ssl.k8syun.com SSL 证书信息查询与检测工具
- https://api.k8syun.com 对外 API 服务接口与平台化实践
- github项目地址 https://github.com/Liu-fu-gui
技术总览(15K 定位)
- 方向定位:Kubernetes + 云GPU + AIGC 平台运维
- 核心能力:AI 推理服务稳定性、API 服务治理、自动化交付
- 平台经验:AutoDL 云GPU + Stable Diffusion / ComfyUI / ChatGPT API / MJ
- 工程能力:Jenkins + GitLab CI + Harbor + Kubernetes
- 运维开发:Python Flask API、Vue3 管理界面、AI 辅助编程
- 可观测性:Prometheus / Grafana / GPU 指标 / ELK 日志分析
个人优势
Kubernetes / AIGC 平台运维工程师,专注于云GPU 推理服务的稳定性、资源治理与自动化交付。
具备 3年以上运维与平台实践经验,长期基于 AutoDL 云GPU 平台 进行 AI 推理服务的部署与运维,通过 API + 容器化方式 对 Stable Diffusion、ComfyUI、ChatGPT API、MidJourney(MJ)等服务进行统一管理与对外提供能力。
熟悉 云GPU 环境下的 AIGC 运维模式,能够围绕 并发控制、任务调度、失败重试、服务稳定性与成本约束 设计运行方案,而非单纯依赖硬件堆叠。 具备 Jenkins + GitLab CI + Harbor + Kubernetes 的完整 CI/CD 实践经验,可在云 GPU 场景下实现模型服务的快速发布、回滚与版本管理。
在可观测性方面,能够基于 Prometheus / Grafana / ELK 对推理服务请求量、延迟、错误率进行监控与分析,并通过日志与指标快速定位 API 级问题。 同时具备 Shell / Python 自动化能力,并结合 AI 编程工具 提升运维开发效率,整体能力高度匹配 15K 的 K8s + AIGC 运维工程师 岗位需求。
技术能力栈
一、核心能力
- Kubernetes / 云GPU 平台运维
- K8s 集群上 AI 推理服务的部署、扩容、回滚与故障排查
- 云GPU 推理服务运行治理(并发控制、资源配额、稳定性保障)
-
Helm 标准化部署与版本管理
-
AIGC / AI 服务运维
- Stable Diffusion、ComfyUI、ChatGPT API、MJ 长期在线运维
- 多模型并发场景下的 API 稳定性与服务治理
- 推理异常定位与恢复
二、工程与交付能力(价值放大器)
- CI/CD & DevOps
- Jenkins + GitLab CI + Harbor 持续集成
- 镜像构建、自动发布、快速回滚
-
CI/CD 与 Kubernetes 自动化集成
-
可观测性
- Prometheus / Grafana
- GPU 相关指标监控
- ELK 日志集中采集与分析
三、平台与运维开发能力
- Python / Flask
-
编写轻量级 API,用于推理服务封装、任务调度与状态查询
-
Vue3
-
构建简易运维管理界面,用于任务状态、请求统计与运行展示
-
AI 编程
- 使用 AI 辅助编程完成脚本、API 与自动化逻辑,提高开发与运维效率
四、支撑能力
- Shell、Python 自动化脚本
- Nginx、MySQL、Keepalived
- 阿里云 ECS / 云GPU、OSS、VPC、安全组
- Linux(CentOS / Ubuntu)、TCP/IP、HTTP/HTTPS、DNS
工作经历
上海秒保经纪股份有限公司
自动化测试工程师 | 2021.09 - 2022.12
- 使用 Python 编写自动化测试脚本,支撑接口与系统稳定性验证
- 参与性能与并发测试(JMeter),为系统上线提供数据支撑
- 与开发、运维协作,通过日志、接口与数据库分析定位问题
浙江省直公积金
运维工程师 | 2023.01 - 2024.05
- 使用 Zabbix 进行服务器与系统监控
- 编写脚本监控 CPU、内存、磁盘使用率
- 负责服务器部署、巡检与故障处理
- 协助系统上线及高可用环境保障
- 推动运维流程规范化,提升系统稳定性
盐城市非狐科技有限公司
运维 / AIGC 平台工程师 | 2023.08 - 2024.05
- 基于云GPU 平台规划 AI 服务运行环境,保障推理服务稳定运行
- 搭建并维护 Stable Diffusion、ComfyUI、ChatGPT、MJ 等 AIGC 服务
- 编写自动化脚本,提升日常运维与平台管理效率
- 维护数据库与业务数据安全
项目经验
云GPU AIGC 推理服务平台(AutoDL)
- 基于 AutoDL 云GPU 平台 部署 AIGC 推理服务,通过 API 方式 对外提供能力
- 支撑 Stable Diffusion、ComfyUI、ChatGPT API、MidJourney(MJ)等模型并发使用
- 平台 日均请求量 8,000+,面向多用户生成与调用场景
- 使用 容器化 + Helm 管理推理服务运行环境,保障部署一致性与可回滚性
- 围绕 请求并发、任务排队、失败重试 设计服务治理策略,保障高峰期 API 稳定
- 使用 Python / Flask 封装推理 API,统一服务入口与状态返回
- 使用 Vue3 构建轻量级管理界面,用于任务状态与运行情况展示
- 构建 Prometheus + Grafana 监控体系,监控请求量、延迟与错误率
- Python 自动化任务调度与补偿机制,整体成功率保持在 98% 以上
K8s + Jenkins + GitLab 持续交付平台
- 在 0→1 参与构建 基于 Kubernetes 的 CI/CD 发布体系
- 结合 Jenkins + GitLab + Harbor 实现代码构建、镜像制作、自动发布与回滚
- 使用 Jenkins Pipeline / Jenkinsfile 实现标准化发布流程
- 支持 多环境发布(dev / uat / pre / prod) 与灰度、回滚策略
- 输出服务接入与发布规范,推动业务系统统一接入 CI/CD 平台
- 提升发布稳定性与效率,降低人工干预风险
全链路日志与可观测性平台
- 参与公司 日志与链路追踪体系的统一规划与落地
- 使用 ELK(Elasticsearch / Logstash / Kibana) 实现日志集中采集与分析
- 结合 Kafka、Canal 实现日志与数据的高吞吐、低延迟采集
- 使用 SkyWalking 实现分布式链路追踪,辅助快速定位服务瓶颈
- 对 Elasticsearch 进行参数与索引优化,提升日志查询性能
- 显著缩短故障定位时间,提高线上问题处理效率
监控与告警体系重构(Prometheus)
- 重构原有监控体系,统一为 Prometheus + Grafana 架构
- 引入 (ITM) 作为统一告警平台
- 基于业务维度设计监控指标、告警规则与告警分组
- 优化告警策略、告警抑制与降噪,显著降低无效告警数量
- 编写自动化脚本,实现新机器快速接入监控体系
- 提升告警准确率与运维响应效率
自动化运维平台(Python + Vue)
- 参与构建公司内部 自动化运维平台 / 运维中台
- 后端基于 Python(flask),前端使用 Vue,采用前后端分离架构
- 平台功能包括:资产管理(CMDB)、工单审批、批量执行、定时任务等
- 用于规范运维操作流程,降低人工运维成本
- 提升服务器资产管理与运维操作的可控性与效率
教育经历
信阳职业技术学院 | 软件工程 | 大专 2019.09 - 2022.06
专业证书
- 全国计算机等级考试(二级)
- Red Hat Certified System Administrator(RHCSA)
- Red Hat Certified Engineer(RHCE)