7

ICU を使用して漢字数字で構成される Unicode 文字列を解析し、文字列の整数値を返したい関数を作成しています。

"五" => 5
"三十一" => 31
"五千九百七十二" => 5972

ロケールを Locale::getJapan() に設定し、 NumberFormat::parse() を使用して文字列を解析しています。ただし、漢字を渡すたびに、parse() メソッドは U_INVALID_FORMAT_ERROR を返します。

ICU が NumberFormat::parse() メソッドで漢字文字列をサポートしているかどうか知っている人はいますか? ロケールを日本語に設定しているので、漢字数値を解析できることを期待していました。

ありがとう!

#include <iostream>
#include <unicode/numfmt.h>

using namespace std;

int main(int argc, char **argv) {
    const Locale &jaLocale = Locale::getJapan();
    UErrorCode status = U_ZERO_ERROR;
    NumberFormat *nf = NumberFormat::createInstance(jaLocale, status);

    UChar number[] = {0x4E94}; // Character for '5' in Japanese '五'
    UnicodeString numStr(number);
    Formattable formattable;
    nf->parse(numStr, formattable, status);
    if (U_FAILURE(status)) {
        cout << "error parsing as number: " << u_errorName(status) << endl;
        return(1);
    }
    cout << "long value: " << formattable.getLong() << endl;
}
4

4 に答える 4

6

ICUルールベースの数値形式(RBNF)モジュールrbnf.h(C ++)を使用するか、Cの場合はunum.hでUNUM_SPELLOUTオプションを使用し、両方とも日本語の「ja」ロケールで使用できます。Atryomは、C++のコードに修正を提供します。new RuleBasedNumberFormat(URBNF_SPELLOUT,jaLocale, status);

于 2009-10-07T17:29:51.377 に答える
3

少し前に、これを行うための小さな perl モジュールを作成しました。アラビア語<=>日本語を変換できます。徹底的にテストしていませんが、かなり包括的だと思います。自由に改善してください。

 
package kanjiArabic;
use strict;
use warnings;
our $VERSION = "1.00";
use utf8;

our %big = (
    十 => 10,百 => 100,千 => 1000,
    );
our %bigger = (
    万 => 10000,億 => 100000000,
    兆 => 1000000000000,京 => 10000000000000000,
    垓 => 100000000000000000000,
    );
#precompile regexes                                                                                                          
our $qr = qr/[0-9]/;
our $bigqr = qr/[十百千]/;
our $biggerqr = qr/[万億兆京垓]/;

#this routine does most of the real work.
sub kanji2arabic{
    $_ = shift;

    tr/〇一二三四五六七八九/0123456789/;
    #optionally precompile for performance boost                                                                             
    s/(?<=${qr})(${bigqr})/\*${1}/g;
    s/(?<=${bigqr})(${bigqr})/\+${1}/g;
    s/(${bigqr})(?=${qr})/${1}\+/g;
    s/(${bigqr})(?=${bigqr})/${1}\+/g;
    s/(${bigqr})/${big{$1}}/g;

    s/([0-9\+\*]+)/\(${1}\)/g;

    s/(? "〇", 1 => "一", 2 => "二", 3 => "三", 4 => "四",
    5 => "五", 6 => "六", 7 => "七", 8 => "八", 9 => "九",
    );
our %places = (
    1 => 10, 
    2 => 100, 
    3 => 1000, 
    4 => 10000, 
    8 => 100000000, 
    12 => 1000000000000,
    16 => 10000000000000000, 
    20 => 100000000000000000000,
    );
our %abig   = (
    10 => "十", 
    100 => "百", 
    1000 => "千", 
    10000 => "万", 
    100000000 => "億",
    1000000000000 => "兆", 
    10000000000000000 => "京", 
    100000000000000000000 => "垓",
    );
our $MAX = 24; #We only support numbers up to 24 digits!                                                                     


sub arabic2kanji{
    my @number = reverse(split(//,$_[0]));
    my @kanji;
    for(my $i=$#number;$i>=0;$i--){
        if( $i==0 ){push(@kanji,$asmall{$number[$i]});}
        elsif( $i % 4 == 0 ){
            if( $number[$i] !~ m/[01]/ ){
                push(@kanji,$asmall{$number[$i]});
            }
            push(@kanji,$abig{$places{$i}});
    }else{
            my $p = $i % 4;
            if( $number[$i]==0 ){
                next;
            }elsif( $number[$i]==1 ){
                push(@kanji,$abig{$places{$p}});
            }else{
                push(@kanji,$asmall{$number[$i]});
        push(@kanji,$abig{$places{$p}});
            }
    }
    }
    return join("",@kanji);
}


sub eval_k2a{
    #feed me utf-8!                                                                                                          
    if($_[0] !~ m/^[〇一二三四五六七八九十百千万億兆京垓]+$/){
        print "Error: ".$_[0].
              " not a Kanji number.\n" if defined($_[1])&&$_[1]==1;
        return -1;
    }
    my $expression = kanji2arabic($_[0]);
    print $expression."\n" if defined($_[1])&&$_[1]==1;
    return eval($expression);
}



1;

次に、別のスクリプトから次のように呼び出します。


#!/usr/bin/perl -w
use strict;
use warnings;
use Encode;
use kanjiArabic;

my $kanji = kanjiArabic::arabic2kanji($ARGV[0]);
print "Kanji: ".encode("utf8",$kanji)."\n";
my $arabic =  kanjiArabic::eval_k2a($kanji);
print "Back to arabic...\n";
print "Arabic: ".$arabic."\n";

このスクリプトを次のように使用します。


kettle:~/k2a$ ./k2a.pl 5000215
Kanji: 五百万二百十五
Back to arabic...
Arabic: 5000215

ロックオン。

于 2009-05-04T09:49:13.167 に答える
1

Python を使用してこの問題を解決するために、あなたの質問に触発されました。

C++ の解決策が見つからない場合でも、これを C++ に適応させるのは難しくありません。

于 2009-04-28T05:21:59.943 に答える
0

これは実際には非常に困難です。特に、非常に大きな数字のあいまいな漢字を見始める場合はなおさらです。

perl では、Lingua::JA::Numbersに非常に完全な実装があります。C++ に移植したい場合は、ソースがインスピレーションになるかもしれません。

于 2010-03-23T05:37:33.837 に答える