<think>我们之前通过`docker run`命令部署了Nacos v2.3.2集群,但是遇到了启动时一直显示`nacos is starting`的问题。现在我们需要解决这个问题。
根据引用[5]中提到的问题,Nacos集群在启动时日志一直停留在`Nacos is starting...`,这可能与几种情况有关:
1. 网络配置问题:集群节点之间无法互相通信,特别是用于RAFT选举的7848端口和用于gRPC通信的9848/9849端口。
2. 宿主机资源不足(如内存不足)导致JVM无法启动。
3. 配置错误:例如`cluster.conf`文件内容不正确或环境变量配置有误。
4. 时间同步问题:如果节点之间的时间不同步,可能会导致RAFT选举失败。
针对不使用docker-compose的情况,我们可以按照以下步骤排查:
**步骤1:检查网络配置**
确保我们创建了专用的docker网络,并且每个容器都分配了固定的IP,且容器之间可以相互通信。
我们之前创建了网络`nacos-cluster-net`,并且为每个容器指定了IP(172.20.0.11, 172.20.0.12, 172.20.0.13)。现在需要验证容器间端口是否开放。
使用以下命令进入其中一个容器,然后尝试用`telnet`(如果没有安装telnet,可以安装或使用`nc`)测试其他容器的7848、9848和9849端口:
```bash
docker exec -it nacos-node1 bash
apt-get update && apt-get install -y telnet # 如果是Alpine镜像,使用apk add
telnet 172.20.0.12 7848
telnet 172.20.0.12 9848
telnet 172.20.0.12 9849
```
如果无法连通,请检查:
- 容器启动时是否正确映射了这些端口(注意:在集群内部通信使用的是容器内端口,所以容器之间通过固定IP和内部端口通信,不需要宿主机的端口映射。但是我们的`docker run`命令中已经映射了这些端口到宿主机,并且通过`-p`参数发布,但这并不影响容器间的直接通信,因为容器间通过一个网桥网络通信。因此,实际上我们只需要确保容器间的这些端口在同一个网络下是可以互相访问的,即通过`nacos-cluster-net`网络直接通信。所以,在`docker run`命令中,我们发布的端口是为了让外部访问8848(控制台)和gRPC端口(9848,9849)用于客户端,但是集群内部节点通信使用的是容器内部的IP和端口,所以我们在容器内部通过固定IP访问其他节点的7848、9848、9849。如果容器内无法访问,那么可能是防火墙的问题,或者Docker网络配置问题。
另外,注意Nacos2.0以后,除了8848以外,还需要9848(客户端gRPC)和9849(集群间gRPC)以及7848(Raft端口)端口。我们在启动容器时已经映射了前两个(8848和9848、9849),但7848端口我们并没有映射到宿主机(因为集群内部通信使用,不需要暴露给宿主机),但是在`nacos-cluster-net`网络内,节点之间是可以直接访问的。
如果容器内无法连通其他节点的7848等端口,请检查Docker网络设置,确保网络没有问题。
**步骤2:检查日志**
查看每个容器的日志,找到具体错误原因:
```bash
docker logs nacos-node1
docker logs nacos-node2
docker logs nacos-node3
```
重点关注以下错误:
- 与集群通信相关的错误(如连接其他节点失败)
- 数据库连接错误(如果使用了外部数据库)
- 内存不足错误(OOM)
**步骤3:检查内存设置**
在启动命令中我们设置了`-e JVM_XMS=512m -e JVM_XMX=512m`。请确保这个内存设置足够。如果启动时内存不足,可以尝试增大这个值(比如1g)。但也要注意宿主机是否有足够内存。
**步骤4:检查cluster.conf和环境变量NACOS_SERVERS的一致性**
必须保证每个节点中的`cluster.conf`文件内容一致,并且环境变量`NACOS_SERVERS`的内容也要一致,且都是各个节点的容器IP(如172.20.0.11:8848)且可互相访问。
**步骤5:时间同步**
虽然容器会默认使用宿主机的时钟,但要确保宿主机时间同步。各个节点的时间差不应过大。
**步骤6:数据库配置(如果使用外部数据库)**
如果我们配置了外部数据库(如MySQL),确保数据库连接正确,且数据库已经初始化(执行了初始化SQL)。如果使用内嵌数据库则跳过。
在Nacos集群中,通常建议使用外部数据库。如果没有配置,默认使用内嵌数据库,每个节点独立存储,这会导致数据不一致。所以建议配置外部数据库。
**解决方案步骤:**
1. 清理并重新部署:
如果之前有运行旧的容器,先停止并删除它们:
```bash
docker stop nacos-node1 nacos-node2 nacos-node3
docker rm nacos-node1 nacos-node2 nacos-node3
```
2. 使用外部数据库(推荐):
准备一个MySQL数据库,执行Nacos提供的初始化SQL(可在Nacos的conf目录下找到`mysql-schema.sql`)。然后配置每个节点使用该数据库。
在每个节点的配置目录下(如`/data/nacos/node1/conf`)创建`application.properties`文件,内容如下:
```properties
spring.datasource.platform=mysql
db.num=1
db.url.0=jdbc:mysql://<数据库地址>:3306/nacos?characterEncoding=utf8&connectTimeout=1000&socketTimeout=3000&autoReconnect=true&useSSL=false
db.user=用户名
db.password=密码
```
然后,在启动容器时,将这个配置文件挂载进去(确保每个节点配置相同):
```bash
-v /data/nacos/node1/conf/application.properties:/home/nacos/conf/application.properties
```
3. 重新启动容器,并再次检查日志。
如果以上步骤还不能解决问题,可以尝试在启动命令中加入调试参数,例如:
-e NACOS_DEBUG=y
启动后进入容器,查看详细的启动日志(在`/home/nacos/logs`目录下)。
根据引用[5]中提到的第二种问题(关于cluster-hostname.yaml和cluster-ip.yaml方式),我们采用的是固定IP的方式(cluster-ip),所以确保IP配置正确。
另外,我们还需要注意,从Nacos2.0版本开始,增加了gRPC的通信,端口是在8848基础上增加1000和1001,即9848和9849。所以在防火墙设置中,要确保这些端口互通。
最后,尝试在启动容器时,使用`--restart=always`参数,以便容器退出时自动重启,但这不能解决启动卡住的问题。
如果问题依旧,可以尝试使用官方提供的`standalone`模式启动单个节点,看是否能够成功。如果单个节点也无法启动,则可能是基础配置问题(如挂载的目录权限等)。
补充:目录权限问题。确保挂载的宿主机目录(如`/data/nacos/node1/data`)对于容器内的nacos用户(1000:1000)有读写权限。可以在启动容器前执行:
```bash
sudo chown -R 1000:1000 /data/nacos
```
总结:我们重点排查网络、内存、配置文件和数据库四个主要方面。
如果以上步骤都检查无误,通常可以解决`nacos is starting`的问题。
</think>
## 解决 Docker 部署 Nacos v2.3.2 集群卡在 "nacos is starting" 问题
以下是针对不使用 Docker Compose 方式部署 Nacos 集群时卡在 "nacos is starting" 的完整解决方案:
### 📍 核心原因分析
1. **端口配置错误**:Nacos 2.x 需要额外暴露 **7848(RAFT)/9848(gRPC)/9849(gRPC)** 端口[^2]
2. **内存分配不足**:容器内存过小导致启动失败(需≥512MB)
3. **集群配置不一致**:`cluster.conf` 或 `NACOS_SERVERS` 配置不匹配
4. **存储权限问题**:映射目录无读写权限
5. **时间不同步**:集群节点时间差超过阈值(>15秒)
### 🛠️ 解决方案步骤
#### 1. 正确端口配置(关键)
```bash
# 节点启动命令(增加关键端口映射)
docker run -d --name node1 \
-p 8848:8848 # 控制台端口
-p 7848:7848 # RAFT端口(必需)
-p 9848:9848 # gRPC端口(必需)
-p 9849:9849 # gRPC端口(必需)
... # 其他参数
```
> **验证端口连通性**:
> ```bash
> telnet 172.20.0.11 7848
> telnet 172.20.0.11 9848
> telnet 172.20.0.11 9849
> ```
#### 2. 内存优化配置
在容器启动命令中添加内存配置:
```bash
-e JVM_XMS=512m -e JVM_XMX=512m # 最小/最大堆内存
-e JVM_XMN=256m # 年轻代大小(可选)
```
#### 3. 集群配置一致性检查
确保所有节点使用相同的 `cluster.conf` 和 `NACOS_SERVERS` 值:
```bash
# cluster.conf 内容参考(所有节点必须一致)
echo '
172.20.0.11:8848
172.20.0.12:8848
172.20.0.13:8848
' > /data/nacos/node1/conf/cluster.conf
# 启动时配置一样的环境变量
-e NACOS_SERVERS="172.20.0.11:8848,172.20.0.12:8848,172.20.0.13:8848"
```
#### 4. 存储权限修复
```bash
# 修复目录权限
chown -R 1000:1000 /data/nascos/* # Nacos容器用户UID:GID
```
#### 5. 完整启动示例
```bash
# 节点1启动命令
docker run -d --name node1 \
--net nacos-net --ip 172.20.0.11 \
-e MODE=cluster \
-e PREFER_HOST_MODE=ip \
-e NACOS_SERVERS="172.20.0.11:8848,172.20.0.12:8848,172.20.0.13:8848" \
-e JVM_XMS=512m -e JVM_XMX=512m \
-v /data/nacos/node1/conf/cluster.conf:/home/nacos/conf/cluster.conf \
-v /data/nacos/node1/data:/home/nacos/data \
-p 8848:8848 -p 7848:7848 -p 9848:9848 -p 9849:9849 \
nacos/nacos-server:v2.3.2
```
### ✅ 验证集群状态
```bash
# 查看启动日志
docker logs node1 --tail 100 | grep "Nacos started successfully"
# API检测(10秒内应返回数据)
time curl -s http://localhost:8848/nacos/v1/core/cluster/serverlist | json_pp
```
### 📊 故障排查表
| 现象 | 排查点 | 解决措施 |
|------|--------|---------|
| 启动30秒后仍无进度 | RAFT端口未开放 | 开启7848+检查防火墙 |
| 出现 "connection refused" | gRPC端口配置错误 | 确保9848/9849映射到所有节点 |
| 节点孤立 | cluster.conf不一致 | 检查所有节点配置文件 |
| 内存OOM错误 | JVM_XMS/XMX不足 | 增大至≥512m |
| 时间戳错误 | 系统时间不同步 | 节点间执行 `ntpdate` |
### 🔍 高级调试
启用详细日志分析:
```bash
docker run ... \
-e NACOS_DEBUG=y \
-e LOG_LEVEL=debug
```
📌 **关键提示**:Nacos 2.x+ 架构要求暴露额外端口,这是与传统 1.x 版本的主要区别[^2]。若仍无法启动,建议先以单节点模式测试:
```bash
docker run -d -e MODE=standalone -p 8848:8848 nacos/nacos-server:v2.3.2
```
---