Files
taiji-AI-PAD/k8s/DEPLOYMENT_STATUS.md
T
2025-12-28 13:28:16 +00:00

3.8 KiB
Raw Blame History

AKS 部署状态报告

部署时间

2025-12-28

部署信息

  • AKS 集群: taiji-ai-pda
  • 资源组: taiji-ai-pda
  • ACR: taiji.azurecr.io
  • 命名空间: taiji-ai
  • 数据库: taiji.postgres.database.azure.com

服务状态

✅ 已成功部署

  1. API Gateway (Nginx)

  2. ConfigMap 和 Secrets

    • ✅ taiji-config (ConfigMap)
    • ✅ taiji-secrets (Secret)
    • ✅ acr-secret (ACR 拉取密钥)

⚠️ 需要修复

  1. MCP Server

    • 状态: CrashLoopBackOff
    • 问题: exec format error - Python 解释器架构不匹配
    • 影响: MCP Server 无法启动
    • 建议: 需要检查 Dockerfile 和构建环境
  2. Data Ingestion

    • 状态: CrashLoopBackOff
    • 问题: 与 MCP Server 相同
    • 影响: 数据接入服务无法启动
  3. LiteLLM Gateway

    • 状态: CrashLoopBackOff
    • 问题: 与 MCP Server 相同
    • 影响: LLM 网关服务无法启动
  4. NATS

    • 状态: CrashLoopBackOff / ContainerCreating
    • 问题: Command 配置问题(已修复,但可能需要重新部署)
    • 影响: 消息队列服务无法启动

已完成的步骤

  1. ✅ 创建命名空间
  2. ✅ 创建 ConfigMap
  3. ✅ 创建 Secrets(数据库已更新为 taiji)
  4. ✅ 创建 ACR 拉取密钥
  5. ✅ 构建并推送 Docker 镜像
  6. ✅ 部署所有服务
  7. ✅ API Gateway 正常运行

待解决问题

1. Python 服务架构问题

问题: exec format error 表示 Python 解释器无法执行,可能是架构不匹配。

可能原因:

  • 构建环境与运行环境架构不一致
  • Docker 镜像构建时未正确指定平台
  • Python 解释器路径问题

解决方案:

  1. 检查构建环境架构: uname -m 和 docker version
  2. 使用 docker buildx 构建多架构镜像
  3. 在 Dockerfile 中明确指定 Python 路径
  4. 考虑使用 python3 而不是 python

2. NATS 服务问题

问题: NATS 容器启动失败

已修复: 更新了 command 配置,但可能需要删除旧 Pod 重新创建

解决方案:

kubectl delete deployment nats -n taiji-ai
kubectl apply -f k8s/nats.yaml

下一步操作

  1. 修复 Python 服务架构问题

    # 检查当前构建环境
    uname -m
    docker version
    
    # 使用 buildx 构建
    docker buildx build --platform linux/amd64 -t taiji.azurecr.io/taiji-mcp-server:latest ./services/mcp-server --push
    
  2. 重新部署服务

    kubectl rollout restart deployment/mcp-server -n taiji-ai
    kubectl rollout restart deployment/data-ingestion -n taiji-ai
    kubectl rollout restart deployment/litellm-gateway -n taiji-ai
    
  3. 验证部署

    kubectl get pods -n taiji-ai
    kubectl logs -f deployment/mcp-server -n taiji-ai
    

访问信息

监控命令

# 查看所有 Pod 状态
kubectl get pods -n taiji-ai

# 查看服务状态
kubectl get services -n taiji-ai

# 查看部署状态
kubectl get deployments -n taiji-ai

# 查看日志
kubectl logs -f deployment/mcp-server -n taiji-ai
kubectl logs -f deployment/data-ingestion -n taiji-ai
kubectl logs -f deployment/litellm-gateway -n taiji-ai

# 查看事件
kubectl get events -n taiji-ai --sort-by='.lastTimestamp'

注意事项

  1. 数据库配置: 已更新为 taiji.postgres.database.azure.com
  2. 不影响本地 Docker: 此部署完全独立,不影响本地 docker-compose 环境
  3. 资源限制: 根据实际需求调整各服务的 CPU 和内存限制
  4. 存储: PVC 使用 managed-premium 存储类