生产单点登录反复跳认证排查 记录时间:2026-09-09 环境:生产单点登录门户(外层 nginx + K8s ingress-nginx + CAS 多副本 + TongWeb WAR 业务系统) 一、问题现象 生产环境切换业务系统时,登录态反复丢失,被踢回 /cas 认证;测试环境一切正常。 最初的排查点就错了:同事拿着 AI 认定是 j_s…
ES transport证书p12到期监控实现(CronJob推送指标) 记录时间:2026-09-07 环境:dyck 生产 K8s(RKE,ARM64 信创节点)/ Elasticsearch 7.17 三节点集群(StatefulSet dyck-elasticsearch,tools namespace)/ VictoriaMetrics …
金仓 KMonitor 自带 Prometheus 接入 VictoriaMetrics 记录 记录时间:2026-09-01 环境:szzx 生产金仓主机 szzxdmdb03(17 网段信创)/ 金仓 KMonitor 自带 kingbase_prometheus(独立二进制,file_sd 服务发现)/ VictoriaMetrics hel…
K8s 集群外部访问 Pod 的几种方式 记录时间:2026-08-20 环境:K8s 1.28 测试集群(Calico 网络插件);生产 K8s 1.28 arm64 集群(MetalLB v0.14.5 L2 模式 + ingress-nginx) 一、背景 集群内访问 Pod 很简单,直接走 Pod IP 或者对应 Service 的 Clu…
Nacos 3.1.1 升级 3.2.4 修复权限绕过漏洞记录 记录时间:2026-08-28 至 2026-08-30 环境:公司测试 / 生产xc / 生产xc-kj 三套 Nacos,nacos-server v3.1.1 升 v3.2.4,K8s StatefulSet 2 副本 + 外置 MySQL,Harbor 内网仓库(信创 ARM6…
Prometheus 切换到 VictoriaMetrics 统一告警的部署记录 记录时间:2026-08-27 环境:RKE 信创 ARM64 双生产集群(clusterA / clusterB)+ 公司测试集群 / victoria-metrics-cluster 0.42.0(v1.143.0-cluster)/ victoria-metri…
Kubernetes 探针(Probe)详解与生产环境配置实践 记录时间:2026-08-20 环境:K8s 1.28(信创 ARM64);Helm Charts:jar / tomcat / tongweb / vue 四类业务 chart(内部 chart 仓库);测试环境 argocd-apps / 生产环境 argocd-prod(Argo…
WAF加白放行渗透流量引发nginx到ingress异常连接的排查 记录时间:2026-07-31 环境:外层 nginx(68.154,/AppHome/nginx2021/)+ ingress-nginx(K8s,10.202.17.x:80)+ WAF 一、问题现象 渗透压测期间,68.154 外层 nginx 大量报两类错: no live…
K8s Deployment 名过长致 Pod 名截断与日志目录代际标识丢失排查 记录时间:2026-07-29 环境:K8s 生产集群 swj-kj-prod(kjds 租户)/ ArgoCD GitOps / Helm chart gzeport-jar 1.2.13 / 共享 NFS 日志 PVC jar-log-data-pvc 一、问题现…
NFS 共享日志盘 75 天写满 11T 排障记录(kjds 生产集群) 记录时间:2026-07-29 环境:K8s 外部集群 swj-kj-prod(kjds 租户)/ ArgoCD GitOps / NFS nfs.chinaunicom.com:/kjdx-sas(12T)/ 15 个 Spring Boot 服务(logback + Na…
K3s 集群证书过期紧急轮换笔记 前言/背景 最近 Prometheus 突然弹出一个 warning 告警,把我吓了一跳。仔细一看是 KubeClientCertificateExpiration,提示 K3s 内置证书还有 7 天就要过期了! 告警主机是 10.196.69.1:6443 (k3s-01)。 emmm,看了一下集群的运行时间,确…
RKE2 全集群 TLS 证书过期导致瘫痪的无损修复 起因 这套 RKE2 集群跑了快 2 年零 19 天,3 Master(k140、k141、k142)+ 2 Worker(k145、k146)的高可用架构。 某天上班发现 kubectl 直接报铁板一块: 然后查看日志: [root@k140 bin]# journalctl -u rke2-…
限制 Kubernetes 本地临时存储的容量 参考文章:如何限制KUBERNETES本地临时存储的容量 本文结合生产环境(K8s 1.28 + Docker)实际配置,深入讲解 ephemeral storage 的原理与最佳实践。 1. 问题背景 作为 Kubernetes 平台的提供方,必须对"流氓"应用做出限制,防止它们滥用 CPU、内存、…
etcd 集群故障排查与节点扩容维护操作手册 文档信息 故障现象:Prometheus 频繁触发 etcd_server_leader_changes_seen_total >= 4 告警(15分钟内集群频繁切换 Leader)。 根本原因:host53 节点物理内存使用率超过 90%,触发操作系统激进的内存回收(Page Cache Rec…
Helm 部署高可用 Redis 集群部署记录 一、部署概述 本文档记录使用 Bitnami Redis Cluster Helm Chart 在 Kubernetes 集群中部署高可用 Redis 集群的完整过程,包括遇到的问题和解决方案。 部署架构 集群模式: Redis Cluster(3主3从) 节点数量: 6 个节点 外部访问: Meta…
MetalLB LoadBalancer 部署手册 环境说明 Kubernetes 集群环境:test-xc(k8s-1.28 arm架构) MetalLB 版本:v0.14.5 部署模式:Layer 2 (L2) 模式 IP 地址池:192.168.120.150-192.168.120.155 安装限制条件 在部署 MetalLB 之前,请确认…
Longhorn安装记录 简介 Longhorn 是一个轻量级、可靠且功能强大的分布式块存储系统,专为 Kubernetes 而设计。它实现了可靠的持久化存储,支持快照、备份和跨集群灾难恢复等企业级功能。 Longhorn 初使用反馈 在测试环境使用6台机器,其中host51-53是master,host54-56是worker,但是呢实际上hos…
安装argocd v2.14.17 前言 ArgoCD是一个基于Kubernetes的GitOps持续交付工具,应用的部署和更新都可以在Git仓库上同步实现,并自带一个可视化界面。本次以2.14.17版本为例,k8s版本是1.28.15 Argocd安装 YAML部署 # yaml版本文件:https://github.com/argoproj/a…
k9s显示乱码问题处理 前言 最近在arm架构上的虚拟机上用k9s,常常遇到乱码情况,如下图: GPT告诉我是因为终端的字符宽度/字体导致的渲染问题(CJK 环境常见)。 k9s 用到的框线/符号在“把模糊宽度字符按双宽处理”的终端里会被算错宽度,于是标题里的字就被隔开成这种效果的。 解决办法 最快的修复方式 仅本次会话: 运行:RUNEWIDTH…
kube-prometheus-stack 中grafana-sc-datasources 错误记录 前言 最近arm架构部署的二进制k8s,使用kube-prometheus-stack部署全家桶,其他业务正常情况下,就grafana下 grafana-sc-dashboard和grafana-sc-datasources出现异常,因为是二进制部…