Como remover uma única linha entre duas linhas

Question

Anna1364

Asked: 2019-04-02 07:10:12 +0800 CST2019-04-02 07:10:12 +0800 CST 2019-04-02 07:10:12 +0800 CST

remover linhas duplicadas

772

Eu tenho um arquivo com várias linhas, aqui está como ele se parece (apenas um cabeçalho de arquivo):

    "chrom" "startA" "stopA" "genesA" "startB" "stopB" "genesB" "test"
    1 315121 317607 "gene2" 315521 317204 "gene3" 1684
    1 315521 317204 "gene3" 315121 317607 "gene2" 1684
    1 407644 408993 "gene4" 408421 409504 "gene5" 573
    1 407644 408993 "gene4" 408616 410013 "gene6" 378
    1 408421 409504 "gene5" 407644 408993 "gene4" 573
    1 408421 409504 "gene5" 408616 410013 "gene6" 889
    1 408616 410013 "gene6" 407644 408993 "gene4" 378
    1 408616 410013 "gene6" 408421 409504 "gene5" 889
    1 408616 410013 "gene6" 409682 411483 "gene7" 332
....

Existem algumas linhas idênticas (o mesmo par de genes, apenas a ordem das posições inicial e final diferem, mas são exatamente as mesmas) que preciso remover a linha repetida. Por exemplo:

1 315121 317607 "gene2" 315521 317204 "gene3" 1684
1 315521 317204 "gene3" 315121 317607 "gene2" 1684

são os mesmos, é a combinação dos genes 2 e 3 apenas em uma ordem diferente e quero remover um deles.

Aqui está minha saída desejada:

"chrom" "startA" "stopA" "genesA" "startB" "stopB" "genesB" "test"
    1 315121 317607 "gene2" 315521 317204 "gene3" 1684
    1 407644 408993 "gene4" 408421 409504 "gene5" 573
    1 407644 408993 "gene4" 408616 410013 "gene6" 378
    1 408421 409504 "gene5" 408616 410013 "gene6" 889
    1 408616 410013 "gene6" 409682 411483 "gene7" 332

Tem alguma ideia de como posso fazer essa tarefa? Obrigado

3 respostas

Voted

glenn jackman · Answer 1 · 2019-04-02T07:48:26+08:00

Best Answer

glenn jackman

2019-04-02T07:48:26+08:002019-04-02T07:48:26+08:00

Você pode tentar:

awk '{key = $4 < $7 ? $4 SUBSEP $7 : $7 SUBSEP $4} !seen[key]++' file

Isso armazena o mínimo necessário para remover os registros duplicados.

!seen[key]++é um idioma awk "famoso" para imprimir um registro apenas pela primeira vez que "chave" é vista.

2

choroba · Answer 2 · 2019-04-02T07:17:32+08:00

choroba

2019-04-02T07:17:32+08:002019-04-02T07:17:32+08:00

Você pode ordenar os trigêmeos das colunas 2-3-4 e 5-6-7 pelo valor na primeira coluna:

perl -lane '@F[1,2,3,4,5,6] = @F[4,5,6,1,2,3] if $F[1] > $F[4]; print "@F"'

Então você pode simplesmente executar sort -upara remover as duplicidades (mas você precisa de maiúsculas e minúsculas nos nomes das colunas).

0

user276072 · Answer 3 · 2019-04-04T16:49:22+08:00

user276072

2019-04-04T16:49:22+08:002019-04-04T16:49:22+08:00

Assegurando em cada linha:

sem espaço até o primeiro campo
1 espaço exato entre o campo
sem espaço no último campo

pelo gnu sed, seus dados no arquivo 'data';

sed -nE ':s G;/(\w+\s)(\w+\s)(\w+\s)(\S+\s)(\w+\s)(\w+\s)(\S+\s)(\w+)\n(.+\n)*\1\w+\s\6\7\w+\s\3\4\8/b; h;P' data

0

remover linhas duplicadas

Possível firmware ausente /lib/firmware/i915/* para o módulo i915

Falha ao buscar o repositório de backports jessie

Como exportar uma chave privada GPG e uma chave pública para um arquivo

Como podemos executar um comando armazenado em uma variável?

Como configurar o systemd-resolved e o systemd-networkd para usar o servidor DNS local para resolver domínios locais e o servidor DNS remoto para domínios remotos?

apt-get update error no Kali Linux após a atualização do dist [duplicado]

Como ver as últimas linhas x do log de serviço systemctl

Nano - pule para o final do arquivo

erro grub: você precisa carregar o kernel primeiro

Como baixar o pacote não instalá-lo com o comando apt-get?

remover linhas duplicadas

3 respostas

relate perguntas