监控
Prometheus 配置
kubectl -n alx-ns get pod -l app.kubernetes.io/component=prometheusNAME READY STATUS RESTARTS AGE
alluxio-cluster-prometheus-6f697b6db8-sbvvg 1/1 Running 0 2mmkdir -p ~/monitoring/prometheusglobal:
scrape_interval: 60s
scrape_configs:
- job_name: "coordinator"
static_configs:
- targets: ["<COORDINATOR_PRIVATE_IP>:19999"]
- job_name: "workers"
static_configs:
- targets: ["<WORKER1_PRIVATE_IP>:30000", "<WORKER2_PRIVATE_IP>:30000"]
- job_name: "fuse"
static_configs:
- targets: ["<FUSE_PRIVATE_IP>:49999"]docker run -d --net=host --name=prometheus \
-v ~/monitoring/prometheus/prometheus.yml:/etc/prometheus/prometheus.yml \
prom/prometheus --config.file=/etc/prometheus/prometheus.ymlKubernetes:使用已有 Prometheus
apiVersion: k8s-operator.alluxio.com/v1
kind: AlluxioCluster
spec:
prometheus:
enabled: falsescrape_configs:
- job_name: 'alluxio-components'
kubernetes_sd_configs:
- role: pod
relabel_configs:
# 仅保留带有 prometheus.io/scrape=true 注解的 Pod
- source_labels: [__meta_kubernetes_pod_annotation_prometheus_io_scrape]
action: keep
regex: true
# 仅保留 Alluxio 组件
- source_labels: [__meta_kubernetes_pod_label_app_kubernetes_io_name]
action: keep
regex: alluxio
# 使用注解中的 metrics 路径,默认为 /metrics
- source_labels: [__meta_kubernetes_pod_annotation_prometheus_io_path]
action: replace
target_label: __metrics_path__
regex: (.+)
# 使用注解中的端口
- source_labels: [__address__, __meta_kubernetes_pod_annotation_prometheus_io_port]
action: replace
regex: ([^:]+)(?::\d+)?;(\d+)
replacement: $1:$2
target_label: __address__
# 从组件名称设置 job 标签
- source_labels: [__meta_kubernetes_pod_label_app_kubernetes_io_component]
action: replace
target_label: job
# 传播集群名称,供多集群 Grafana 仪表板使用
- source_labels: [__meta_kubernetes_pod_label_app_kubernetes_io_instance]
action: replace
target_label: cluster_name
- job_name: 'etcd'
kubernetes_sd_configs:
- role: pod
relabel_configs:
- source_labels: [__meta_kubernetes_pod_annotation_prometheus_io_scrape]
action: keep
regex: true
- source_labels: [__meta_kubernetes_pod_label_app_kubernetes_io_name]
action: keep
regex: etcd
- source_labels: [__address__, __meta_kubernetes_pod_annotation_prometheus_io_port]
action: replace
regex: ([^:]+)(?::\d+)?;(\d+)
replacement: $1:$2
target_label: __address__
- target_label: job
replacement: etcd
- source_labels: [__meta_kubernetes_pod_label_app_kubernetes_io_instance]
action: replace
target_label: cluster_nameGrafana 配置
导入仪表板
仪表板说明
告警规则
进程可用性 — ETCD
字段
取值
字段
取值
进程可用性 — Worker 数量
字段
取值
进程资源
字段
取值
字段
取值
字段
取值
字段
取值
字段
取值
缓存 — 命中率
字段
取值
缓存 — 利用率
字段
取值
缓存 — 淘汰相关性
字段
取值
FUSE — UFS 回退
字段
取值
读取吞吐
字段
取值
数据 — 读请求速率
字段
取值
许可证 — 到期时间
字段
取值
许可证 — 版本不一致
字段
取值
直接查询指标
Datadog 集成
Last updated