关于【degraded】的问题- 第1页

agatek

Asked: 2022-01-09 22:37:17 +0800 CST

zfs 无法识别自己的物理磁盘

1

我对 zfs 池有重复的问题，其中 zfs 停止识别自己的、正确标记（或看起来如此）的物理设备。

Ubuntu 20.04.2 LTS
5.11.0-44-generic #48~20.04.2-Ubuntu SMP Tue Dec 14 15:36:44 UTC 2021 x86_64 x86_64 x86_64 GNU/Linux
libzfs2linux/now 0.8.3-1ubuntu12.11 amd64 [installed,upgradable to: 0.8.3-1ubuntu12.13]
zfs-zed/now 0.8.3-1ubuntu12.11 amd64 [installed,upgradable to: 0.8.3-1ubuntu12.13]
zfsutils-linux/now 0.8.3-1ubuntu12.11 amd64 [installed,upgradable to: 0.8.3-1ubuntu12.13]

模型示例。

我可以创建一个池，连接完全不相关的磁盘（例如 USB、外部），并在重新启动时（使用 USB 磁盘）zfs 报告其池中的一个磁盘丢失。
更改一个（或多个）驱动器的控制器似乎也会发生同样的情况。所有物理磁盘都在那里，所有标签/uuid 似乎都在那里，改变的是设备号分配。

很难相信 zfs 会根据系统设备分配顺序组装池而忽略其标签/uuid，但这就是它的简单外观。

    agatek@mmstorage:~$ zpool status
          pool: mmdata
         state: DEGRADED
        status: One or more devices could not be used because the label is missing or
            invalid.  Sufficient replicas exist for the pool to continue
            functioning in a degraded state.
        action: Replace the device using 'zpool replace'.
           see: http://zfsonlinux.org/msg/ZFS-8000-4J
          scan: scrub in progress since Sun Jan  9 13:03:23 2022
            650G scanned at 1.58G/s, 188G issued at 468M/s, 22.7T total
            0B repaired, 0.81% done, 0 days 14:00:27 to go
        config:

        NAME                                          STATE     READ WRITE CKSUM
        mmdata                                        DEGRADED     0     0     0
          raidz1-0                                    DEGRADED     0     0     0
            ata-HGST_HDN726040ALE614_K7HJG8HL         ONLINE       0     0     0
            6348126275544519230                       FAULTED      0     0     0  was /dev/sdb1
            ata-HGST_HDN726040ALE614_K3H14ZAL         ONLINE       0     0     0
            ata-HGST_HDN726040ALE614_K4K721RB         ONLINE       0     0     0
            ata-WDC_WD40EZAZ-00SF3B0_WD-WX12D514858P  ONLINE       0     0     0
            ata-ST4000DM004-2CV104_ZTT24X5R           ONLINE       0     0     0
            ata-WDC_WD40EZAZ-00SF3B0_WD-WX62D711SHF4  ONLINE       0     0     0
            sdi                                       ONLINE       0     0     0
    
    errors: No known data errors

agatek@mmstorage:~$ blkid 
/dev/sda1: UUID="E0FD-8D4F" TYPE="vfat" PARTUUID="7600a192-967b-417f-b726-7f5524be71a5"
/dev/sda2: UUID="9d8774ec-051f-4c60-aaa7-82f37dbaa4a4" TYPE="ext4" PARTUUID="425f31b2-f289-496a-911b-a2f8a9bb5c25"
/dev/sda3: UUID="e0b8852d-f781-4891-8e77-d8651f39a55b" TYPE="ext4" PARTUUID="a750bae3-c6ea-40a0-bdfa-0523e358018b"
/dev/sdb1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="13253481390530831214" TYPE="zfs_member" PARTLABEL="zfs-5360ecc220877e69" PARTUUID="57fe2215-aa69-2f46-b626-0f2057a2e4a7"
/dev/sdd1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="17929921080902463088" TYPE="zfs_member" PARTLABEL="zfs-f6ef14df86c7a6e1" PARTUUID="31a074a3-300d-db45-b9e2-3495f49c4bee"
/dev/sde1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="505855664557329830" TYPE="zfs_member" PARTLABEL="zfs-6326993c142e4a03" PARTUUID="37f4954d-67fd-8945-82e6-d0db1f2af12e"
/dev/sdg1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="1905592300789522892" TYPE="zfs_member" PARTLABEL="zfs-9d379d5bfd432a2b" PARTUUID="185eff00-196a-a642-9360-0d4532d54ec0"
/dev/sdi1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="15862525770363300383" TYPE="zfs_member" PARTLABEL="zfs-3c99aa22a45c59bf" PARTUUID="89f1600a-b58e-c74c-8d5e-6fdd186a6db0"
/dev/sdh1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="15292769945216849639" TYPE="zfs_member" PARTLABEL="zfs-ee9e1c9a5bde878c" PARTUUID="2e70d63b-00ba-f842-b82d-4dba33314dd5"
/dev/sdf1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="5773484836304595337" TYPE="zfs_member" PARTLABEL="zfs-ee40cf2140012e24" PARTUUID="e5cc3e2a-f7c9-d54e-96de-e62a723a9c3f"
/dev/sdc1: LABEL="mmdata" UUID="16683979255455566941" UUID_SUB="6348126275544519230" TYPE="zfs_member" PARTLABEL="zfs-0d28f0d2715eaff8" PARTUUID="a328981a-7569-294a-bbf6-9d26660e2aad"`

对于上述池，发生了什么，其中一个设备早先发生了故障。我将替换磁盘连接到第二个控制器并执行了替换。它是成功的。游泳池还可以。接下来，故障设备从池中移除并由替换磁盘物理替换（控制器更改）。重新启动后，我将其置于降级状态，其中一个设备报告丢失。清理是由命令 zpool clear 触发的。

因此，正如 blkid 所示，有 8 个磁盘，所有磁盘都正确分区和标记（我认为），但其中一个设备未被识别为池的一部分。在这种情况下该怎么办？这非常烦人。重新同步池需要几天时间。

NON

Asked: 2021-03-19 07:51:14 +0800 CST

更改 SATA 控制器后重新启动时，RAID1 阵列总是降级

1

添加 SATA 控制器后重新启动时，我的软件 RAID1 阵列（/boot、/）总是降级。它是 CentOS 7。这是正在发生的事情和已经完成的事情：

我使用以下设置制作了 4 磁盘 RAID1 阵列：SATA 控制器 A (-HDD1 / -HDD2) + SATA 控制器 B (-HDD3 / -HDD4)
Cont-A 有问题，所以我添加了另一个 Cont-C，并将 HDD1/2 从 Cont-A 移动到 Cont-C。因此，设置如下： Cont-A (none) + Cont-B (-HDD3 / -HDD4) + Cont.C (-HDD1 / -HDD2)
在此交换之后，在每次（重新）启动时，RAID1 阵列总是会降级，只有 HDD3/4 处于活动状态。
我可以将 HDD1/2 重新添加到 RAID1 阵列，但它们在重新启动后再次降级，丢失了 HDD1/2。

我怀疑这是因为 CentOS 在启动阶段没有看到 Cont-C（及其子公司 HDD1/2），因为启动序列停止了大约 2 分钟，而 HDD1/2 很晚才出现在 dmesg 上。

当引导顺序设置为这样时，我可以从 HDD1/2 引导（尽管仍然从 RAID1 丢失 HDD1/2），所以至少 BIOS 可以正确识别 Cont-C。

有没有办法解决这个问题？

dalf

Asked: 2016-06-02 21:33:29 +0800 CST

Ganeti 磁盘降级 drbd cs:NetworkFailure

2

我在 Ganeti 上有一个实例（带有 2 个磁盘），两个磁盘都已降级（可能是由于连接问题？）。直到今天早上，这个实例多年来一直正常工作。

在我的主人

$ gnt-instance info myinstance
...
   -disk/0
      on primary:   /dev/drbd4 (147:4) in sync, status *DEGRADED*
      on secondary: /dev/drbd4 (147:4) in sync, status *DEGRADED*
      child devices:
        - child 0: lvm, size 20.0G
          logical_id:   kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data
          on primary:   /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data (254:10)
          on secondary: /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data (254:8)
        - child 1: lvm, size 128M
          logical_id:   kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta
          on primary:   /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta (254:11)
          on secondary: /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta (254:9)

...

在主节点上

$ cat /proc/drbd
 4: cs:NetworkFailure ro:Primary/Unknown ds:UpToDate/DUnknown C r----
    ns:678399926 nr:0 dw:678315292 dr:25942012 al:22230 bm:16189 lo:0 pe:196 ua:0 ap:195 ep:1 wo:b oos:0

在辅助节点上

$ cat /proc/drbd
 4: cs:WFConnection ro:Secondary/Unknown ds:UpToDate/DUnknown C r----
    ns:0 nr:678340009 dw:678340009 dr:0 al:0 bm:14884 lo:0 pe:0 ua:0 ap:0 ep:1 wo:b oos:0

我无法重新启动或关闭实例（操作超时）。

我认为这不是脑裂问题，因为没有“独立”，并且在主节点上它是“主要/未知”，而在辅助节点上它是“次要/未知”。

我试图在辅助节点上运行“drbdadm connect all”，但什么也没做。

我试图更换磁盘，但失败了：

gnt-instance replace-disks -s myinstance
Thu Jun  2 11:32:00 2016 Replacing disk(s) 0, 1 for myinstancel
Thu Jun  2 11:36:00 2016  - WARNING: Could not prepare block device disk/1 on node primaryNode (is_primary=False, pass=1): Error while assembling disk: drbd5: cannot activate, unknown or unhandled reason
Thu Jun  2 11:38:01 2016  - WARNING: Could not prepare block device disk/0 on node primaryNode (is_primary=True, pass=2): Error while assembling disk: drbd4: cannot activate, unknown or unhandled reason
Thu Jun  2 11:40:02 2016  - WARNING: Could not prepare block device disk/1 on node primaryNode (is_primary=True, pass=2): Error while assembling disk: drbd5: cannot activate, unknown or unhandled reason
Failure: command execution error:
Disk consistency error

现在它看起来像这样：

$ gnt-instance info myinstance
...
    -disk/0 
      on primary:   /dev/drbd4 (147:4) in sync, status *DEGRADED*
      (no more secondary)
      child devices:
        - child 0: lvm, size 20.0G
          logical_id:   kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data
          on primary:   /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data (254:10)
          on secondary: /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_data (254:8)
        - child 1: lvm, size 128M
          logical_id:   kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta
          on primary:   /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta (254:11)
          on secondary: /dev/kvmvg/299a0bdf-1acb-4bcd-ac43-eb02b0928757.disk0_meta (254:9)

在主节点上

$ cat /proc/drbd
 4: cs:NetworkFailure ro:Primary/Unknown ds:UpToDate/DUnknown C r----
    ns:678399926 nr:0 dw:678315292 dr:25942012 al:22230 bm:16189 lo:0 pe:196 ua:0 ap:195 ep:1 wo:b oos:0

在辅助节点上：

$ cat /proc/drbd
...
4: cs:Unconfigured
5: cs:Unconfigured

知道如何解决这个问题吗？

DRBD 版本：8.3.7

加内蒂版本：2.4.5

操作系统：Debian 6.0

user38754

Asked: 2010-03-26 03:30:49 +0800 CST

LTO-4 磁带保质期估计？

2

LTO 磁带（在这种情况下为 Maxell）通常以在“最佳条件”下存储时具有 30 年或更长时间的保质期进行销售

给定相对湿度和温度等参数，有没有办法很好地估计保质期？

除了磁带的过时，有没有一种方法可以确定任何偏离最佳状态对保质期的影响。换句话说，当存储高于指定范围 1 度时会丢失多少年？

zfs 无法识别自己的物理磁盘

更改 SATA 控制器后重新启动时，RAID1 阵列总是降级

Ganeti 磁盘降级 drbd cs:NetworkFailure

LTO-4 磁带保质期估计？

新安装后 postgres 的默认超级用户用户名/密码是什么？

SFTP 使用什么端口？

命令行列出 Windows Active Directory 组中的用户？

什么是 Pem 文件，它与其他 OpenSSL 生成的密钥文件格式有何不同？

如何确定bash变量是否为空？

问题[degraded](server)