API监控、指标与健康检查

通过全面的健康检查、性能指标和告警功能监控Smart Money API。跟踪正常运行时间、延迟、错误率和SLA合规性。

发布于2026年3月21日 13分钟阅读 运维

监控概述

Smart Money API提供全面的监控功能,以跟踪服务的健康状态、性能和可靠性。实施这些监控策略,以便及早发现问题并保持高正常运行时间。

三层监控:

  • 健康检查 — 端点可用性和基本功能
  • 指标 — 性能数据(延迟、吞吐量、错误率)
  • 日志记录 — 请求/响应详细信息,用于调试和审计

目标指标: 99.9%的正常运行时间,<100ms的p95延迟,<0.1%的错误率,<5秒的平均检测时间。

健康检查

API健康端点

健康检查
// 简单的存活检查(无需认证)
GET /health
// 响应
HTTP/1.1 200 OK
{
"status": "healthy",
"timestamp": 1709980800000,
"uptime": 99.95
}

详细健康状态

详细健康
// 包含组件健康状态的详细状态
GET /v1/status
-H "Authorization: Bearer token"
{
"status": "operational",
"components": {
"api": "healthy",
"database": "healthy",
"cache": "healthy",
"exchanges": "healthy"
},
"metrics": {
"p95_latency_ms": 85,
"error_rate": 0.0012,
"uptime_percent": 99.95
}
}
30秒内获取您的API密钥

准备好构建了吗?获取一个免费的API密钥(每天100次调用,无需信用卡),并开始获取实时的鲸鱼、资金和链上数据。

获取您的API密钥 →

指标与监控

关键指标跟踪

指标 目标 告警阈值
正常运行时间 99.9% <99.5%
P95延迟 <100ms >500ms
错误率 <0.1% >1%
请求/秒 变化 接近限制
缓存命中率 >70% <50%

指标API端点

指标查询
// 获取用于监控的API指标
GET /v1/metrics?period=1h
-H "Authorization: Bearer token"
// 返回Prometheus格式的指标
# HELP api_requests_total 总API请求数
# TYPE api_requests_total counter
api_requests_total{method="GET",status="200"} 4502
api_requests_total{method="GET",status="429"} 12

告警设置

Webhook告警

创建告警
POST /v1/alerts
-H "Authorization: Bearer token"
-d '{
"name": "高错误率",
"condition": "error_rate > 0.01",
"webhook_url": "https://hooks.slack.com/...",
"severity": "高"
}'

告警类型

  • 正常运行时间告警 — API不可用超过5分钟
  • 延迟告警 — P95延迟超过阈值
  • 错误率告警 — 错误率超过1%
  • 速率限制告警 — 接近速率限制
  • 数据新鲜度告警 — 数据超过阈值

请求日志

日志级别

日志示例
// 典型的API请求日志条目
{
"timestamp": "2026-03-21T14:00:00Z",
"request_id": "req_abc123def456",
method: GET,
path: /v1/whales/btc,
status: 200,
duration_ms: 45,
user_id: acct_12345
}

结构化日志

所有日志均为结构化JSON格式,便于解析与分析:

  • ISO 8601格式的时间戳
  • 用于追踪的请求ID
  • HTTP方法和路径
  • 响应状态与延迟
  • 用户ID及API密钥指纹
  • 错误信息(如适用)

分布式追踪

请求ID追踪

追踪头信息
// 所有请求均包含追踪头信息
curl -H "X-Request-ID: req-abc123" \
https://api.smartmoneyapi.com/v1/whales
// 响应包含相同ID
X-Request-ID: req-abc123
X-Response-Time: 45ms
X-Server: api-prod-01

追踪上下文传播

分布式系统采用W3C追踪上下文标准:

W3C追踪上下文
// 请求包含追踪上下文
traceparent: 00-4bf92f3577b34da6a3ce929d0e0e4736-00f067aa0ba902b7-01
tracestate: dd=s:0
// 追踪ID: 4bf92f3577b34da6a3ce929d0e0e4736
// 跨度ID: 00f067aa0ba902b7
// 已采样: true (01)

SLA监控

服务等级目标

计划 正常运行时间SLA 响应时间 支持
免费版 99% 尽力而为 社区
交易者版 99.5% <200ms p95 邮件支持
专业版 99.95% <100ms p95 优先支持
企业版 99.99% <50ms p95 专属支持

SLA积分补偿

若正常运行时间低于SLA,将获得服务积分补偿:

  • 99.0% - 99.5%: 10%月度积分
  • 95.0% - 99.0%: 25%月度积分
  • < 95.0%: 100%月度积分

监控仪表盘

内置仪表盘

访问性能仪表盘:https://status.smartmoney.io

自定义仪表盘设置

Prometheus查询
// 查询API请求率
rate(api_requests_total[5m])
// 查询错误率
rate(api_requests_total{status=~"5.."}[5m])
// 查询延迟百分位数
histogram_quantile(0.95, api_request_duration_ms)

监控工具集成

支持平台

工具 集成方式 功能特性
Prometheus 原生/metrics端点 指标抓取
Grafana 数据源插件 自定义仪表盘
Datadog API集成 APM追踪
New Relic 代理集成 全栈可观测性
PagerDuty Webhook告警 事件管理

监控最佳实践

1. 监控关键指标

聚焦直接影响业务的指标:正常运行时间、延迟、错误率。

2. 设置合理告警

基于症状告警而非阈值,按严重程度路由告警。

3. 使用请求ID

始终通过唯一ID关联请求以实现端到端追踪。

4. 实施分布式追踪

采用W3C追踪上下文标准实现微服务间可视化。

5. 定期测试告警

每月测试告警通道以确保升级流程有效。

6. 记录告警响应

为常见告警创建包含解决步骤的应急预案手册。

确保99.9%正常运行时间

通过全面的健康检查、指标和告警监控Smart Money API。利用内置可观测性工具维持SLA合规性。

立即开始
专业版和企业版计划包含专属支持与SLA监控。

相关资源

免费开始 — 每日100次调用,无需绑卡

通过单一API获取3大交易所的巨鲸资金流、资金费率、未平仓合约及链上数据。免费层级无需信用卡,随时升级。

免费开始 →
试用实时API控制台 → (无需账户)