私の関連質問に関するこのスクリプトを受け取りました。csvの先頭にファイル名とタイトルを挿入する方法
find . -name '*.csv' -printf "%f\n" |
sed 's/.csv$//' |
xargs -I{} sed -i '1s/^/customer|/ '$'\n'' 1!s/^/{}|/' {}.csv;
現在、大容量ファイルの場合はかなり時間がかかります。ファイルを50,000に拡張してこの結果を得ました。
real 1m41.251s
user 0m59.326s
sys 0m38.681s
100,000個のファイルに対してこれを取得します。
real 3m18.466s
user 1m58.451s
sys 1m16.550s
du -sh
100,000個のファイルは485Mです。このデータを10〜20GBに拡張したいと思います。
上記のスクリプトをスピードアップする方法があるかどうか疑問に思います。私は仕事をスピードアップするためにどんなツールを使用するかを意図しています。
役に立つ場合は、Ubuntu 18.04.02 LTS、16GB RAMを使用しています。
time awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' *.csv
real 0m20.253s
user 0m3.336s
sys 0m14.854s
sed
オリジナルよりはるかに高速です。 :o。理由がわからない。誰かがそれを説明することができれば、それは非常に役立ちます。
ファイルを百万まで拡張すると、上記のスクリプトにArgument list too long
。
次のように試しましたが、非常に遅かったです。
find . -name \*.csv -exec awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' {} \;
一括しても10万個のファイルまでは遅いようです。
time find . -name "10*.csv" -exec awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' {} \;
real 9m29.474s
user 2m3.336s
sys 6m37.822s
Edの答えを使って一般的なforループを試しましたが、生成された元のファイルと同じ速度で動作しているようです。 100万のレコードを作成するのに約40分かかりました。
for file in *.csv; do
echo "$file"
awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' "$file"
done
私は100,000個のファイルごとにバッチ処理を試みましたが、ls
Edxargs
が提供した初期ソリューションの後に合理的に見えます。
time ls 11*.csv | xargs awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}'
real 0m23.619s
user 0m3.537s
sys 0m15.272s
time ls 12*.csv | xargs awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}'
real 0m25.044s
user 0m3.892s
sys 0m16.261s
time ls 13*.csv | xargs awk -i inplace -v OFS='|' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}'
real 0m24.997s
user 0m4.035s
sys 0m16.757s
現在の計画は、バッチのためにforループを使用して上記の解決策を使用することです。各バッチの平均時間を25秒と仮定すると、約25 * 10 - > 4分かかります。数百万件の記録が早いと思います。
誰でもより良い解決策があれば教えてください。上記のコードの間違ったもの/間違ったコードがある場合はお知らせください。まだ初心者なので、コピーや理解がうまくいかないかもしれません。
答え1
$ awk -v OFS=',' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' 10000000.csv
customer,first_name,middle_name,last_name,gender,email,phone_number,address,city,state,country,date_order_start,date_order_complete,invoice_number,invoice_date,item,item_price,quantity,cost,job_name,job_price,total_cost
10000000,Chae,Jesusa,Cummings,Female,[email protected],555-555-8750,911 Hauser Pike,Moline,Georgia,Cameroon,2016-06-29,2016-07-16,36298,2016-07-17,Acer,493.86,14,354.77,Broken,123.68,898.13
したがって、awkに対して次のことができます。
for file in *.csv; do
awk 'script' "$file" > tmp && mv tmp "$file"
done
または、「内部」編集にGNU awkを使用してください。
$ tail -n +1 10000000.csv 10000001.csv
==> 10000000.csv <==
first_name,middle_name,last_name,gender,email,phone_number,address,city,state,country,date_order_start,date_order_complete,invoice_number,invoice_date,item,item_price,quantity,cost,job_name,job_price,total_cost
Chae,Jesusa,Cummings,Female,[email protected],555-555-8750,911 Hauser Pike,Moline,Georgia,Cameroon,2016-06-29,2016-07-16,36298,2016-07-17,Acer,493.86,14,354.77,Broken,123.68,898.13
==> 10000001.csv <==
first_name,middle_name,last_name,gender,email,phone_number,address,city,state,country,date_order_start,date_order_complete,invoice_number,invoice_date,item,item_price,quantity,cost,job_name,job_price,total_cost
Fleta,Rosette,Hurley,Other,[email protected],1-555-555-1210,35 Freelon Arcade,Beaverton,Rhode Island,Cayman Islands,2009-06-08,2009-06-29,39684,2009-07-01,NVIDIA GeForce GTX 980,474.31,16,395.79,Broken,157.53,1088.04
Bennett,Dennis,George,Male,[email protected],(555) 555-4131,505 Robert C Levy Arcade,Wellington,Louisiana,Mexico,2019-05-09,2019-05-19,37938,2019-05-21,8GB,187.67,16,205.77,Service,170.21,1007.85
Tommye,Pamula,Diaz,Other,[email protected],555.555.4445,1001 Canby Boulevard,Edinburg,Massachusetts,Gambia,2004-05-02,2004-05-24,31364,2004-05-26,Lenovo,137.21,13,193.63,Replacement,246.43,934.31
Albert,Jerrold,Cohen,Other,[email protected],+1-(555)-555-8491,1181 Baden Avenue,Menomonee Falls,Texas,Tajikistan,2019-08-03,2019-08-12,37768,2019-08-15,Intel® Iris™ Graphics 6100,396.46,17,223.02,Service,118.53,960.27
Louetta,Collene,Best,Fluid,[email protected],1-555-555-7050,923 Barry Viaduct,Laurel,Illinois,St. Barthélemy,2009-03-02,2009-03-06,39557,2009-03-07,AMD Radeon R9 M395X,133.9,11,198.49,Fix,178.54,1055.32
Kandace,Wesley,Diaz,Female,[email protected],+1-(555)-555-5414,341 Garlington Run,Santa Maria,New Jersey,Mexico,2005-10-09,2005-10-10,30543,2005-10-14,Samsung,590.29,5,354.85,Service,292.56,1032.22
。
$ awk -i inplace -v OFS=',' 'FNR==1{cust=FILENAME; sub(/\.csv$/,"",cust)} {print (FNR>1 ? cust : "customer"), $0}' 10000000.csv 10000001.csv
。
$ tail -n +1 10000000.csv 10000001.csv
==> 10000000.csv <==
customer,first_name,middle_name,last_name,gender,email,phone_number,address,city,state,country,date_order_start,date_order_complete,invoice_number,invoice_date,item,item_price,quantity,cost,job_name,job_price,total_cost
10000000,Chae,Jesusa,Cummings,Female,[email protected],555-555-8750,911 Hauser Pike,Moline,Georgia,Cameroon,2016-06-29,2016-07-16,36298,2016-07-17,Acer,493.86,14,354.77,Broken,123.68,898.13
==> 10000001.csv <==
customer,first_name,middle_name,last_name,gender,email,phone_number,address,city,state,country,date_order_start,date_order_complete,invoice_number,invoice_date,item,item_price,quantity,cost,job_name,job_price,total_cost
10000001,Fleta,Rosette,Hurley,Other,[email protected],1-555-555-1210,35 Freelon Arcade,Beaverton,Rhode Island,Cayman Islands,2009-06-08,2009-06-29,39684,2009-07-01,NVIDIA GeForce GTX 980,474.31,16,395.79,Broken,157.53,1088.04
10000001,Bennett,Dennis,George,Male,[email protected],(555) 555-4131,505 Robert C Levy Arcade,Wellington,Louisiana,Mexico,2019-05-09,2019-05-19,37938,2019-05-21,8GB,187.67,16,205.77,Service,170.21,1007.85
10000001,Tommye,Pamula,Diaz,Other,[email protected],555.555.4445,1001 Canby Boulevard,Edinburg,Massachusetts,Gambia,2004-05-02,2004-05-24,31364,2004-05-26,Lenovo,137.21,13,193.63,Replacement,246.43,934.31
10000001,Albert,Jerrold,Cohen,Other,[email protected],+1-(555)-555-8491,1181 Baden Avenue,Menomonee Falls,Texas,Tajikistan,2019-08-03,2019-08-12,37768,2019-08-15,Intel® Iris™ Graphics 6100,396.46,17,223.02,Service,118.53,960.27
10000001,Louetta,Collene,Best,Fluid,[email protected],1-555-555-7050,923 Barry Viaduct,Laurel,Illinois,St. Barthélemy,2009-03-02,2009-03-06,39557,2009-03-07,AMD Radeon R9 M395X,133.9,11,198.49,Fix,178.54,1055.32
10000001,Kandace,Wesley,Diaz,Female,[email protected],+1-(555)-555-5414,341 Garlington Run,Santa Maria,New Jersey,Mexico,2005-10-09,2005-10-10,30543,2005-10-14,Samsung,590.29,5,354.85,Service,292.56,1032.22
コマンドラインに渡すファイルが多すぎてxargsを介して実行するのが遅すぎる場合は、他のオプションがあります。
awk -i inplace ... '
BEGIN {
while ( (getline line < ARGV[1]) > 0 ) {
if ( line ~ /\.csv$/ ) {
ARGV[ARGC] = line
ARGC++
}
}
ARGV[1] = ""
}
{ the "real" script }
' <(ls)
上記のコードは、ls
引数の代わりに入力ファイルへの出力を読み取り、で終わるファイル名で引数の配列を入力し、コマンドラインから引数として渡されたかの.csv
ようにファイルに対して機能します。
答え2
次の 2 つの方法を試すことができます。
$ find . -name \*.csv -type f ! -empty -exec \
perl -spe 's/^/,/;
$F //= $ARGV =~ s/\.csv$//r;
s/^/$. == 1 ? "\n$C" : $F/e;
undef $F, close ARGV if eof;
' -- -C="Customer" {} +
2つ目はGnu sed機能を利用します。具体的には、Fコマンドを使用してファイル名を取得し、-sオプションを使用して複数のファイルを単一のストリームではなく個別に処理します。
$ find . -name \*.csv -type f ! -empty -exec \
sed -se 'F;1s/^/CUSTOMER,/' {} + |
sed -E \
-e 'N;s/.*\.csv(\nCUSTOMER,)/\1/;t' \
-e 's/\.csv\n/,/;s/..//' \
;