Python不明なXMLエンティティを解析するためのElementTreeサポート？

Question

解析する超単純なXMLファイルのセットがあります...しかし...それらはカスタム定義されたエンティティを使用します。これらを文字にマッピングする必要はありませんが、それぞれを解析して処理したいと思います。例えば：

<Style name="admin-5678"> <Rule> <Filter>[admin_level]='5'</Filter> &maxscale_zoom11; </Rule> </Style>

http://effbot.org/elementtree/elementtree-xmlparser.htm に興味をそそるヒントがあります。XMLParserのエンティティサポートは制限されていますが、上記のメソッドが見つかりません。すべてエラーが発生します。

 #!/usr/bin/python ## ## Where's the entity support as documented at: ## http://effbot.org/elementtree/elementtree-xmlparser.htm ## In Python 2.7.1+ ? ## from pprint import pprint from xml.etree import ElementTree from cStringIO import StringIO parser = ElementTree.ElementTree() #parser.entity["maxscale_zoom11"] = unichr(160) testf = StringIO('<foo>&maxscale_zoom11;</foo>') tree = parser.parse(testf) #tree = parser.parse(testf,"XMLParser") for node in tree.iter('foo'): print node.text

コメントの調整方法に応じて、次のようになります。

xml.etree.ElementTree.ParseError: undefined entity: line 1, column 5

または

AttributeError: 'ElementTree' object has no attribute 'entity'

または

AttributeError: 'str' object has no attribute 'feed'

好奇心旺盛な人のために、XMLは OpenStreetMap のmapnikプロジェクトからのものです。

cnelson · Accepted Answer

これがElementTreeのバグなのかどうかはわかりませんが、以前と同じように動作するには、expatパーサーでUseForeignDTD（True）を呼び出す必要があります。

少しハッキーですが、ElementTree.Parserの独自のインスタンスを作成し、そのインスタンスのxml.parsers.expatでメソッドを呼び出して、それをElementTree.parse（）に渡すことでこれを行うことができます。

from xml.etree import ElementTree from cStringIO import StringIO testf = StringIO('<foo>&moo_1;</foo>') parser = ElementTree.XMLParser() parser.parser.UseForeignDTD(True) parser.entity['moo_1'] = 'MOOOOO' etree = ElementTree.ElementTree() tree = etree.parse(testf, parser=parser) for node in tree.iter('foo'): print node.text

「MOOOOO」を出力します

または、マッピングインターフェイスを使用します。

from xml.etree import ElementTree from cStringIO import StringIO class AllEntities: def __getitem__(self, key): #key is your entity, you can do whatever you want with it here return key testf = StringIO('<foo>&moo_1;</foo>') parser = ElementTree.XMLParser() parser.parser.UseForeignDTD(True) parser.entity = AllEntities() etree = ElementTree.ElementTree() tree = etree.parse(testf, parser=parser) for node in tree.iter('foo'): print node.text

これは「moo_1」を出力します

より複雑な修正は、ElementTree.XMLParserをサブクラス化し、そこで修正することです。

RayLuo · Answer

@cnelsonがコメントですでに指摘しているように、ここで選択したソリューションはPython 3では機能しません。

私はついにそれを機能させました。これから引用 Q＆A 。

この投稿に触発されて、受信する生のHTMLコンテンツにXML定義を追加するだけで、ElementTreeはそのままで機能します。

これは、Python 2.6、2.7、3.3、3.4の両方で機能します。

import xml.etree.ElementTree as ET html = '''<html> <div>Some reasonably well-formed HTML content.</div> <form action="login"> <input name="foo" value="bar"/> <input name="username"/><input name="password"/> <div>It is not unusual to see &nbsp; in an HTML page.</div> </form></html>''' magic = '''<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd" [ <!ENTITY nbsp ' '> ]>''' # You can define more entities here, if needed et = ET.fromstring(magic + html)