AskOverflow.Dev

AskOverflow.Dev Logo AskOverflow.Dev Logo

AskOverflow.Dev Navigation

    • 主页
    • 系统&网络
    • Ubuntu
    • Unix
    • DBA
    • Computer
    • Coding
    • LangChain

Mobile menu

Close
  • 主页
  • 系统&网络
    • 最新
    • 热门
    • 标签
  • Ubuntu
    • 最新
    • 热门
    • 标签
  • Unix
    • 最新
    • 标签
  • DBA
    • 最新
    • 标签
  • Computer
    • 最新
    • 标签
  • Coding
    • 最新
    • 标签
主页 / ubuntu / 问题 / 661080
Accepted
Lynob
Lynob
Asked: 2015-08-14 10:14:26 +0800 CST2015-08-14 10:14:26 +0800 CST 2015-08-14 10:14:26 +0800 CST

搜索数列

  • 772

假设你有一个包含 500 万行的 file1.csv,每行有 8 个随机数,用逗号分隔。你有这个序列7,152,13,11,42,5,7

如何输出 file1.csv 中的行,其中包含该序列中的 3 个或更多数字以及行号?

perl
  • 2 2 个回答
  • 106 Views

2 个回答

  • Voted
  1. Best Answer
    glenn jackman
    2015-08-14T10:49:56+08:002015-08-14T10:49:56+08:00

    有趣的。我会用awk

    awk -F, -v seq="7,152,13,11,42,5,7" '
        BEGIN {
            n = split(seq, a)
            for (i=1; i<=n; i++) num[a[i]]=1
        }
        { 
            n=0
            for (i=1; i<=NF; i++) { 
                if ($i in num) n++
                if (n == 3) {
                    print
                    break
                }
            }
        }
    ' bigfile
    

    可以预见,perl 更简洁

    export seq="7,152,13,11,42,5,7"
    perl -F, -lane '
        BEGIN {%nums = map {$_ => 1} split /,/, $ENV{seq}} 
        print if scalar(grep {exists $nums{$_}} @F) >= 3
    ' file
    
    • 3
  2. heemayl
    2015-08-14T10:54:08+08:002015-08-14T10:54:08+08:00

    这是python完成这项工作的脚本:

    #!/usr/bin/env python2
    nums = set('7,152,13,11,42,5,7'.split(','))
    with open('/path/to/file.txt') as f:
        f = enumerate(f, start=1)
        for i, line in f:
            if len(set.intersection(nums, set(line.split(',')))) >= 3:
                print str(i) + ': ' + line.rstrip()
    
    • ,将包含我们要匹配的set数字nums

    • 我们创建了一个enumerate对象来获取行号并遍历这些行

    • set.intersection(nums, set(line.split(',')))nums从和中获取共同的数字line

    • 如果该序列中有 3 个或更多数字出现在行if len(....) >= 3中,则将打印行号和行。

    输出将是这样的:

    1: 7,152,13,11,42,5,45
    2: 7,152,1,5,7,34,44
    3: 7,152,13,11,42,5,7
    5: 11,42,5,7,7,152,13
    

    还要考虑到数字不必按照提到的确切顺序出现,它们可以按任何顺序出现。

    • 3

相关问题

  • 如何设置语言环境?

Sidebar

Stats

  • 问题 205573
  • 回答 270741
  • 最佳答案 135370
  • 用户 68524
  • 热门
  • 回答
  • Marko Smith

    如何运行 .sh 脚本?

    • 16 个回答
  • Marko Smith

    如何安装 .tar.gz(或 .tar.bz2)文件?

    • 14 个回答
  • Marko Smith

    如何列出所有已安装的软件包

    • 24 个回答
  • Marko Smith

    无法锁定管理目录 (/var/lib/dpkg/) 是另一个进程在使用它吗?

    • 25 个回答
  • Martin Hope
    Flimm 如何在没有 sudo 的情况下使用 docker? 2014-06-07 00:17:43 +0800 CST
  • Martin Hope
    Ivan 如何列出所有已安装的软件包 2010-12-17 18:08:49 +0800 CST
  • Martin Hope
    La Ode Adam Saputra 无法锁定管理目录 (/var/lib/dpkg/) 是另一个进程在使用它吗? 2010-11-30 18:12:48 +0800 CST
  • Martin Hope
    David Barry 如何从命令行确定目录(文件夹)的总大小? 2010-08-06 10:20:23 +0800 CST
  • Martin Hope
    jfoucher “以下软件包已被保留:”为什么以及如何解决? 2010-08-01 13:59:22 +0800 CST
  • Martin Hope
    David Ashford 如何删除 PPA? 2010-07-30 01:09:42 +0800 CST

热门标签

10.10 10.04 gnome networking server command-line package-management software-recommendation sound xorg

Explore

  • 主页
  • 问题
    • 最新
    • 热门
  • 标签
  • 帮助
subwaysurfers
my femboy roommate

Footer

AskOverflow.Dev

关于我们

  • 关于我们
  • 联系我们

Legal Stuff

  • Privacy Policy

Language

  • Pt
  • Server
  • Unix

© 2023 AskOverflow.DEV All Rights Reserve