crazydragon777提出的问题 -coding

crazydragon777

Asked: 2025-04-16 06:09:30 +0800 CST

Qual é a melhor maneira de agrupar por mais de uma coluna?

Basicamente, quero agrupar todos os registros que correspondem a qualquer uma das chaves

Entrada:

|id|key1|key2|
|-|-|-|
|1|a|x|
|2|a|y|
|3|b|y|
|4|c|z|

Saída desejada: (As 3 primeiras linhas são agrupadas)

|key1 (or any identifier, I only care about the final counts)|len|
|-|-|
|a|3|
|c|1|

Minha tentativa de solução (incompleta):

import polars as pl

df = pl.DataFrame({
    'id': [1, 2, 3, 4],
    'key1': ['a', 'a', 'b', 'c'],
    'key2': ['x', 'y', 'y', 'z'],
})
df = (
    df.group_by(
        'key1',
        'key2',
    )
    .len()
    .group_by('key1')
    .agg(
        pl.col('key2'),
        pl.col('len').sum()
    )
)
print(df)

O que dá:

|key1|key2|len|
|-|-|-|
|a|["y", "x"]|2|
|b|["y"]|1|
|c|["z"]|1|

No entanto, não tenho certeza de como agruparia isso ainda mais por key2 (mesclando as linhas a e b, já que elas têm um valor comum de y) preservando a soma de len

crazydragon777

Asked: 2024-08-23 00:33:12 +0800 CST

Existe uma maneira eficiente de incluir todas as colunas não selecionadas restantes em uma seleção python-polars?

Estou tentando reordenar as colunas em um dataframe Polars e colocar 5 colunas de 100 primeiro (infelizmente, o documento deve ser legível no Excel). Não consigo encontrar uma maneira fácil de fazer isso.

Idealmente, eu gostaria de algo simples como

df.select(
    'col2',
    'col1',
    r'^.*$',  # the rest of the columns, but this throws a duplicate column name error
)

Lookahead negativo não é suportado, portanto não é possível criar um regex que exclua minhas colunas selecionadas. Eu poderia fazer duas seleções sobrepostas, eliminar as colunas de uma seleção e depois juntá-las, mas essa não parece ser a maneira pretendida de fazer isso. Todas as outras soluções que encontrei envolvem nomear explicitamente cada coluna, o que estou tentando evitar à medida que as colunas são adicionadas ou mudam de nome com certa frequência.

Qual é a melhor maneira de agrupar por mais de uma coluna?

Existe uma maneira eficiente de incluir todas as colunas não selecionadas restantes em uma seleção python-polars?

Reformatar números, inserindo separadores em posições fixas

Por que os conceitos do C++20 causam erros de restrição cíclica, enquanto o SFINAE antigo não?

Problema com extensão desinstalada automaticamente do VScode (tema Material)

Vue 3: Erro na criação "Identificador esperado, mas encontrado 'import'" [duplicado]

Qual é o propósito de `enum class` com um tipo subjacente especificado, mas sem enumeradores?

Como faço para corrigir um erro MODULE_NOT_FOUND para um módulo que não importei manualmente?

`(expression, lvalue) = rvalue` é uma atribuição válida em C ou C++? Por que alguns compiladores aceitam/rejeitam isso?

Um programa vazio que não faz nada em C++ precisa de um heap de 204 KB, mas não em C

PowerBI atualmente quebrado com BigQuery: problema de driver Simba com atualização do Windows

AdMob: MobileAds.initialize() - "java.lang.Integer não pode ser convertido em java.lang.String" para alguns dispositivos

crazydragon777's questions