运维实战

服务器、部署、监控、故障处理实践

21
篇文章
84
阅读量
Kubernetes Gateway API + Cilium 实战:TLS、灰度、跨命名空间与 Hubble 排障

Kubernetes Gateway API + Cilium 实战:TLS、灰度、跨命名空间与 Hubble 排障

从 CRD 与 GatewayClass 到 HTTPS、HTTPRoute 权重灰度、ReferenceGrant、CiliumNetworkPolicy 和 Hubble...

TY
2026-09-28 · 43 分钟
多集群 CI/CD 实战:Git + Jenkins + Kubernetes + Harbor 分阶段发布

多集群 CI/CD 实战:Git + Jenkins + Kubernetes + Harbor 分阶段发布

把 Git、Jenkins、Kubernetes 构建/测试/生产集群与双 Harbor 串成可审计流水线:rootless BuildKit、同一...

TY
2026-09-26 · 51 分钟
Kubernetes 日志平台实战:Filebeat + Kafka + Elasticsearch Ingest Pipeline + Kibana

Kubernetes 日志平台实战:Filebeat + Kafka + Elasticsearch Ingest Pipeline + Kibana

不使用 Logstash:由节点 Filebeat 采集到 Kafka,消费端 Filebeat 写入 Elasticsearch Ingest Pipeline 完...

TY
2026-09-26 · 59 分钟
Kubernetes 日志平台实战:Filebeat + Kafka + Logstash + Elasticsearch + Kibana

Kubernetes 日志平台实战:Filebeat + Kafka + Logstash + Elasticsearch + Kibana

用 Filebeat、Strimzi Kafka、Logstash 与 ECK 构建可缓冲、可重放、可检索的生产日志链路,覆盖安全、背压...

TY
2026-09-24 · 64 分钟
Jenkins on Kubernetes CI/CD:临时 Agent、镜像构建、自动发布与安全回滚

Jenkins on Kubernetes CI/CD:临时 Agent、镜像构建、自动发布与安全回滚

使用 Jenkins Kubernetes 插件与 rootless BuildKit 构建可追溯镜像,通过最小 RBAC 自动部署、验收并在失...

TY
2026-09-24 · 47 分钟
Prometheus + VictoriaMetrics 生产优化:远程写入、长期存储与性能调优

Prometheus + VictoriaMetrics 生产优化:远程写入、长期存储与性能调优

以本地短保留加 VictoriaMetrics 长保留为主线,详解 remote_write、Grafana 双数据源、vmagent 演进、高基...

TY
2026-09-24 · 44 分钟
Kubernetes 生产监控实战:Prometheus + Grafana 完整部署、告警与容量治理

Kubernetes 生产监控实战:Prometheus + Grafana 完整部署、告警与容量治理

从零部署 kube-prometheus-stack,完成持久化、ServiceMonitor、PrometheusRule、Alertmanager、Grafana、...

TY
2026-09-24 · 53 分钟
Nginx 反向代理实战:配置、验证与 502/504 故障定位

Nginx 反向代理实战:配置、验证与 502/504 故障定位

从确认上游服务到配置代理、无中断加载,再用分层方法定位 502 与 504,建立可复制的 Nginx 排障流程。

TY
2026-09-23 · 8 分钟
Kubernetes 生产运维:高可用、升级、etcd 备份与灾难恢复演练

Kubernetes 生产运维:高可用、升级、etcd 备份与灾难恢复演练

把高可用拓扑、逐小版本升级、etcd 快照恢复、工作负载备份、容量规划和灾备演练串成可执行生产流程。

TY
2026-09-23 · 19 分钟
Kubernetes API 与控制器原理:List-Watch、CRD 和 Operator

Kubernetes API 与控制器原理:List-Watch、CRD 和 Operator

沿着一次 API 请求理解认证、授权、准入、存储与 watch,再实现幂等控制循环并掌握 CRD/Operator 边界。

TY
2026-09-22 · 18 分钟
Kubernetes 可观测性与故障排查:日志、指标、事件和性能调优

Kubernetes 可观测性与故障排查:日志、指标、事件和性能调优

建立事件、日志、指标和追踪的证据链,用固定顺序排查 Pending、CrashLoopBackOff、网络和性能问题。

TY
2026-09-21 · 16 分钟
Kubernetes 安全加固:RBAC、Pod Security、准入与网络隔离

Kubernetes 安全加固:RBAC、Pod Security、准入与网络隔离

以最小权限为主线,完成 ServiceAccount、RBAC、Pod Security Admission、安全上下文、秘密保护和网络隔离...

TY
2026-09-20 · 18 分钟