次のようなデータを含む大きなファイルがあります。
a 23
b 8
a 22
b 1
これを取得できるようにしたい:
a 45
b 9
最初にこのファイルを並べ替えてから、Python でファイルを 1 回スキャンして並べ替えます。これを行うための適切な直接コマンドラインの方法は何ですか?
次のようなデータを含む大きなファイルがあります。
a 23
b 8
a 22
b 1
これを取得できるようにしたい:
a 45
b 9
最初にこのファイルを並べ替えてから、Python でファイルを 1 回スキャンして並べ替えます。これを行うための適切な直接コマンドラインの方法は何ですか?
編集:数年前のコメントで述べたように、最新の(GNU / Linux)ソリューション;-) .
awk '{
arr[$1]+=$2
}
END {
for (key in arr) printf("%s\t%s\n", key, arr[key])
}' file \
| sort -k1,1
sort
古い Unixオプションに基づいて、最初に投稿されたソリューション:
awk '{
arr[$1]+=$2
}
END {
for (key in arr) printf("%s\t%s\n", key, arr[key])
}' file \
| sort +0n -1
これが役立つことを願っています。
ここでは awk もソートも必要ありません。Bash 4.0 を使用している場合は、連想配列を使用できます。
#!/bin/bash
declare -A values
while read key value; do
values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
printf "%s %s\n" "$key" "${values[$key]}"
done
...または、最初にファイルをソートすると (メモリ効率が向上します。GNU ソートは、メモリよりも大きなファイルをソートするトリックを実行できます。これは、awk、python、またはシェルのいずれであっても、通常は単純なスクリプトです)しません)、古いバージョンで動作する方法でこれを行うことができます (以下は bash 2.0 で動作することを期待しています):
#!/bin/bash
read cur_key cur_value
while read key value; do
if [[ $key = "$cur_key" ]] ; then
cur_value=$(( cur_value + value ))
else
printf "%s %s\n" "$cur_key" "$cur_value"
cur_key="$key"
cur_value="$value"
fi
done
printf "%s %s\n" "$cur_key" "$cur_value"
このPerlワンライナーは仕事をしているようです:
perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile
GNU awk (バージョン 4 未満) の場合:
WHINY_USERS= awk 'END {
for (E in a)
print E, a[E]
}
{ a[$1] += $2 }' infile
GNU awk >= 4の場合:
awk 'END {
PROCINFO["sorted_in"] = "@ind_str_asc"
for (E in a)
print E, a[E]
}
{ a[$1] += $2 }' infile
を使用した片道perl
:
perl -ane '
next unless @F == 2;
$h{ $F[0] } += $F[1];
END {
printf qq[%s %d\n], $_, $h{ $_ } for sort keys %h;
}
' infile
の内容infile
:
a 23
b 8
a 22
b 1
出力:
a 45
b 9