perl - URLのキリル文字をエンコードしてからデコードする方法は?

Question

1ページにフォームがあります：

<form method="POST" accept-charset="UTF-8" action="index.cgi" name="TestForm">

入力フィールド「search_string」の 1 つを使用してキリル文字を送信できます。その場合、URL 文字列は次のようになります。

search_string=%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D

投稿先のページでこれをデコードして元の文字列に戻すにはどうすればよいですか?

score 5 · Accepted Answer

スペースを含む正しい解決策:

use open ':std', ':encoding(UTF-8)';
use Encode;

my $escaped = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
(my $unescaped = $escaped) =~ s/\+/ /g;
$unescaped =~ s/%([[:xdigit:]]+)/chr hex $1/eg;
print $unescaped;
# П/Ф ПОДЖАРКА ИЗ СВИН

Renaud Bompuisは、これらがで始まる Unicode コードポイントであることを最初に認識した功績があり%ます。

質問のエンコーディング方式は非常に珍しいことを付け加えたいと思います。これまでに見たことがありません。П/Ф ПОДЖАРКА ИЗ СВИН通常、文字列はとしてエンコードされると予想され%D0%9F%2F%D0%A4+%D0%9F%D0%9E%D0%94%D0%96%D0%90%D0%A0%D0%9A%D0%90+%D0%98%D0%97+%D0%A1%D0%92%D0%98%D0%9Dます。つまり、最初に文字が UTF-8 にエンコードされ、次にオクテットがパーセントエスケープされます。このスキームは、カメレオン博士からの回答で機能します。

score 2 · Accepted Answer

+元の文字列のおよびその他の文字を保持するソリューション：

my $s = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
$s =~ s/%([[:xdigit:]]+)/chr(hex($1))/eg;
print $s;

結果：

П/Ф+ПОДЖАРКА+ИЗ+СВИН

score 1 · Accepted Answer

スクリプトでそれを試してください ( index.cgi) :

use Encode;

それで...

$search_string = decode_utf8( $search_string );

別のアイデア (CGI 入力の UTF8 対応のハッシュを作成する場合):

require Encode;
require CGI;
my $query = CGI ->new;
my $form_input = {};  
foreach my $name ( $query ->param ) {
  my @val = $query ->param( $name );
  foreach ( @val ) {
    $_ = Encode::decode_utf8( $_ );
  }
  $name = Encode::decode_utf8( $name );
  if ( scalar @val == 1 ) {   
    $form_input ->{$name} = $val[0];
  } else {                      
    $form_input ->{$name} = \@val;  # save value as an array ref
  }
}

から取得: http://ahinea.com/en/tech/perl-unicode-struggle.html

perl - URLのキリル文字をエンコードしてからデコードする方法は?

3 に答える 3

Related

Reference