gitosis 干扰 hadoop

Question

innervoice

Asked: 2020-01-21 21:59:26 +0800 CST2020-01-21 21:59:26 +0800 CST 2020-01-21 21:59:26 +0800 CST

列出 hdfs 目录下的所有文件

772

由于某个组件的一些错误，HDFS 中的文件累积并且数量巨大，即 2123516。我想列出所有文件并将它们的名称复制到一个文件中，但是当我运行以下命令时，它会给出 Java 堆空间错误.

hdfs dfs -ls /tmp/content/

Exception in thread "main" java.lang.OutOfMemoryError: Java heap space
    at java.util.Arrays.copyOf(Arrays.java:3332)
    at java.lang.AbstractStringBuilder.expandCapacity(AbstractStringBuilder.java:137)
    at java.lang.AbstractStringBuilder.ensureCapacityInternal(AbstractStringBuilder.java:121)
    at java.lang.AbstractStringBuilder.append(AbstractStringBuilder.java:421)
    at java.lang.StringBuffer.append(StringBuffer.java:272)
    at java.net.URI.appendSchemeSpecificPart(URI.java:1911)
    at java.net.URI.toString(URI.java:1941)
    at java.net.URI.<init>(URI.java:742)
    at org.apache.hadoop.fs.Path.initialize(Path.java:145)
    at org.apache.hadoop.fs.Path.<init>(Path.java:126)
    at org.apache.hadoop.fs.Path.<init>(Path.java:50)
    at org.apache.hadoop.hdfs.protocol.HdfsFileStatus.getFullPath(HdfsFileStatus.java:215)
    at org.apache.hadoop.hdfs.DistributedFileSystem.makeQualified(DistributedFileSystem.java:252)
    at org.apache.hadoop.hdfs.DistributedFileSystem.listStatus(DistributedFileSystem.java:311)
    at org.apache.hadoop.fs.FileSystem.listStatus(FileSystem.java:842)
    at org.apache.hadoop.fs.FileSystem.listStatus(FileSystem.java:902)
    at org.apache.hadoop.fs.FileSystem.globStatusInternal(FileSystem.java:1032)
    at org.apache.hadoop.fs.FileSystem.globStatus(FileSystem.java:987)
    at org.apache.hadoop.fs.FileSystem.globStatus(FileSystem.java:965)
    at org.apache.hadoop.fs.shell.Command.runAll(Command.java:62)
    at org.apache.hadoop.fs.FsShell.run(FsShell.java:1822)
    at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65)
    at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:79)
    at org.apache.hadoop.fs.FsShell.main(FsShell.java:1895)

有没有其他方法可以列出文件以及列出 2400000 个文件需要多少堆空间？

1 个回答

Voted

mazaneicha · Answer 1 · 2020-06-11T14:10:16+08:00

Best Answer

mazaneicha

2020-06-11T14:10:16+08:002020-06-11T14:10:16+08:00

HADOOP_HEAPSIZE您可以尝试通过设置env来增加 CLI 堆大小。变量，例如：

$ HADOOP_HEAPSIZE=1000 hdfs dfs -ls /tmp/content

数字以 MB 为单位，所以要温柔:)

更大的问题是您将如何处理控制台上超过 2M 的文件？您不打算将输出重定向到某个地方吗？

1

列出 hdfs 目录下的所有文件

新安装后 postgres 的默认超级用户用户名/密码是什么？

SFTP 使用什么端口？

命令行列出 Windows Active Directory 组中的用户？

什么是 Pem 文件，它与其他 OpenSSL 生成的密钥文件格式有何不同？

如何确定bash变量是否为空？

列出 hdfs 目录下的所有文件

1 个回答

相关问题