python - Jinja の nl2br フィルターで Python UnicodeDecodeError を回避する

Question

次のような Jinja2 の nl2br フィルターを使用しています。

import re
from jinja2 import environmentfilter, Markup, escape

_paragraph_re = re.compile(r'(?:\r\n|\r|\n){2,}')

@evalcontextfilter
def nl2br(eval_ctx, value):
    result = u'\n\n'.join(u'<p>%s</p>' % p.replace('\n', '<br>\n')
                      for p in _paragraph_re.split(escape(value)))
    if eval_ctx.autoescape:
        result = Markup(result)
    return result

問題は、「値」にASCII文字以外が含まれている場合です(たとえば、「/mɒnˈtænə/」では失敗します)。次のエラーが表示されます。

Traceback (most recent call last):
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/app.py", line 889, in __call__
    return self.wsgi_app(environ, start_response)
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/app.py", line 879, in wsgi_app
    response = self.make_response(self.handle_exception(e))
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/app.py", line 876, in wsgi_app
    rv = self.dispatch_request()
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/app.py", line 695, in dispatch_request
    return self.view_functions[rule.endpoint](**req.view_args)
  File "/home/mcrittenden/Dropbox/Code/dropdo/dropdo.py", line 105, in view
    return render_template(template, src = url, data = content)
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/templating.py", line 85, in render_template
    context, ctx.app)
  File "/usr/local/lib/python2.6/dist-packages/Flask-0.6.1-py2.6.egg/flask/templating.py", line 69, in _render
    rv = template.render(context)
  File "/usr/local/lib/python2.6/dist-packages/Jinja2-2.5.5-py2.6.egg/jinja2/environment.py", line 891, in render
    return self.environment.handle_exception(exc_info, True)
  File "/home/mcrittenden/Dropbox/Code/dropdo/templates/text.html", line 1, in top-level template code
    {% extends "layout.html" %}
  File "/home/mcrittenden/Dropbox/Code/dropdo/templates/layout.html", line 25, in top-level template code
    {% block content %}{% endblock %}
  File "/home/mcrittenden/Dropbox/Code/dropdo/templates/text.html", line 8, in block "content"
    {{ data|nl2br }}
  File "/home/mcrittenden/Dropbox/Code/dropdo/dropdo.py", line 26, in nl2br
    for p in _paragraph_re.split(escape(value)))
UnicodeDecodeError: 'ascii' codec can't decode byte 0xc9 in position 12: ordinal not in range(128)

問題のある文字を完全に削除せずにエラーを防ぐにはどうすればよいですか?

score 13 · Accepted Answer

13

unicodeどこでもリテラルを使用します。

「Python の Unicode、完全に解明」

于 2011-02-25T17:11:15.237 に答える

score 6 · Accepted Answer

「値」にアスキー文字以外が含まれている場合は、明示的にエンコードまたはデコードするいくつかの場所を除いて、アプリ全体で Unicode にする必要があります。テンプレートにも Unicode を渡します。

文字列 "/mɒnˈtænə/" を取得した場合、おそらくそのエンコーディングを知っているでしょう。それを使用します value = "/mɒnˈtænə/".decode(the_encoding)。

エンコーディングをどのように学習しますか？HTTP リクエストは、そのエンコーディングを認識しています。XML ファイルは、そのエンコーディングを認識しています。プレーンテキストファイルは通常そうではありません。他の方法でそのエンコーディングを知る必要があります。

UTF-8 は Unicodeを完全に表現できるエンコーディングですが、Unicode ではないことに注意してください。それはまだエンコーディングであり、そこから Python Unicode 文字列を取得するには、それが必要です.decode("utf-8")。

score 0 · Accepted Answer

http://pypi.python.org/pypi/Unidecodeから unidecode を試してください

>>> from unidecode  import unidecode
>>> m=u'My fianc\xe9 David'; print m; print unidecode(m)
My fiancé David
My fiance David
>>>

python - Jinja の nl2br フィルターで Python UnicodeDecodeError を回避する

3 に答える 3

Related

Reference