ElementTreeを使用してXMLから辞書へのパーサーを探しています。すでにいくつかは見つかりましたが、それらは属性を除外しており、私の場合はたくさんの属性があります。
def etree_to_dict(t):
d = {t.tag : map(etree_to_dict, t.iterchildren())}
d.update(('@' + k, v) for k, v in t.attrib.iteritems())
d['text'] = t.text
return d
として呼び出す
tree = etree.parse("some_file.xml")
etree_to_dict(tree.getroot())
これは、実際に属性text
がない限り機能します。その場合は、関数本体の3行目を変更して別のキーを使用してください。また、これでは混合コンテンツを処理できません。
(LXMLでテスト済み。)
次のXML-to-Python-dictスニペットは、エンティティと、 このXML-to-JSON "仕様" に続く属性を解析します。
from collections import defaultdict
def etree_to_dict(t):
d = {t.tag: {} if t.attrib else None}
children = list(t)
if children:
dd = defaultdict(list)
for dc in map(etree_to_dict, children):
for k, v in dc.items():
dd[k].append(v)
d = {t.tag: {k: v[0] if len(v) == 1 else v
for k, v in dd.items()}}
if t.attrib:
d[t.tag].update(('@' + k, v)
for k, v in t.attrib.items())
if t.text:
text = t.text.strip()
if children or t.attrib:
if text:
d[t.tag]['#text'] = text
else:
d[t.tag] = text
return d
使用されます:
from xml.etree import cElementTree as ET
e = ET.XML('''
<root>
<e />
<e>text</e>
<e name="value" />
<e name="value">text</e>
<e> <a>text</a> <b>text</b> </e>
<e> <a>text</a> <a>text</a> </e>
<e> text <a>text</a> </e>
</root>
''')
from pprint import pprint
d = etree_to_dict(e)
pprint(d)
この例の出力(上記のリンクされた「仕様」による)は次のようになります。
{'root': {'e': [None,
'text',
{'@name': 'value'},
{'#text': 'text', '@name': 'value'},
{'a': 'text', 'b': 'text'},
{'a': ['text', 'text']},
{'#text': 'text', 'a': 'text'}]}}
必ずしもきれいではありませんが、それは明白であり、より単純なXML入力はより単純なJSONになります。 :)
reverseを実行し、-JSON/dictからXML文字列を発行する場合は、次のように使用できます。
try:
basestring
except NameError: # python3
basestring = str
def dict_to_etree(d):
def _to_etree(d, root):
if not d:
pass
Elif isinstance(d, str):
root.text = d
Elif isinstance(d, dict):
for k,v in d.items():
assert isinstance(k, str)
if k.startswith('#'):
assert k == '#text' and isinstance(v, str)
root.text = v
Elif k.startswith('@'):
assert isinstance(v, str)
root.set(k[1:], v)
Elif isinstance(v, list):
for e in v:
_to_etree(e, ET.SubElement(root, k))
else:
_to_etree(v, ET.SubElement(root, k))
else:
assert d == 'invalid type', (type(d), d)
assert isinstance(d, dict) and len(d) == 1
tag, body = next(iter(d.items()))
node = ET.Element(tag)
_to_etree(body, node)
return node
print(ET.tostring(dict_to_etree(d)))
@larsmansに基づいて、属性が必要ない場合、これにより、よりタイトな辞書が得られます-
def etree_to_dict(t):
return {t.tag : map(etree_to_dict, t.iterchildren()) or t.text}
python辞書から/にXMLを変換する場合、 xmltodict は私にとってはうまくいきました:
import xmltodict
xml = '''
<root>
<e />
<e>text</e>
<e name="value" />
<e name="value">text</e>
<e> <a>text</a> <b>text</b> </e>
<e> <a>text</a> <a>text</a> </e>
<e> text <a>text</a> </e>
</root>
'''
xdict = xmltodict.parse(xml)
xdictは次のようになります
OrderedDict([('root',
OrderedDict([('e',
[None,
'text',
OrderedDict([('@name', 'value')]),
OrderedDict([('@name', 'value'),
('#text', 'text')]),
OrderedDict([('a', 'text'), ('b', 'text')]),
OrderedDict([('a', ['text', 'text'])]),
OrderedDict([('a', 'text'),
('#text', 'text')])])]))])
XMLデータが未加工の文字列/バイト形式ではなく、ElementTreeオブジェクトにある場合は、それを文字列として出力し、xmldict.parseを再度使用するだけです。たとえば、lxmlを使用してXMLドキュメントを処理している場合、
from lxml import etree
e = etree.XML(xml)
xmltodict.parse(etree.tostring(e))
上記と同じ辞書を生成します。
XMLから辞書に直接変換するこのスニペットを使用できます
import xml.etree.ElementTree as ET
xml = ('<xml>' +
'<first_name>Dean Christian</first_name>' +
'<middle_name>Christian</middle_name>' +
'<last_name>Armada</last_name>' +
'</xml>')
root = ET.fromstring(xml)
x = {x.tag: root.find(x.tag).text for x in root._children}
# returns {'first_name': 'Dean Christian', 'last_name': 'Armada', 'middle_name': 'Christian'}
from lxml import etree, objectify
def formatXML(parent):
"""
Recursive operation which returns a tree formated
as dicts and lists.
Decision to add a list is to find the 'List' Word
in the actual parent tag.
"""
ret = {}
if parent.items(): ret.update(dict(parent.items()))
if parent.text: ret['__content__'] = parent.text
if ('List' in parent.tag):
ret['__list__'] = []
for element in parent:
ret['__list__'].append(formatXML(element))
else:
for element in parent:
ret[element.tag] = formatXML(element)
return ret
次に、xmlの単純なデータ構造を示します(file.xmlとして保存)。
<?xml version="1.0" encoding="UTF-8"?>
<Data>
<Person>
<First>John</First>
<Last>Smith</Last>
</Person>
<Person>
<First>Jane</First>
<Last>Doe</Last>
</Person>
</Data>
これから辞書オブジェクトのリストを作成するコードは次のとおりです。
from lxml import etree
tree = etree.parse('file.xml')
root = tree.getroot()
datadict = []
for item in root:
d = {}
for elem in item:
d[elem.tag]=elem.text
datadict.append(d)
datadictには以下が含まれます:
[{'First': 'John', 'Last': 'Smith'},{'First': 'Jane', 'Last': 'Doe'}]
次のようにアクセスできます:
datadict[0]['First']
'John'
datadict[1]['Last']
'Doe'
@larsmansに基づいて構築し、結果のキーにxml名前空間情報が含まれている場合、dictに書き込む前にそれを削除できます。変数xmlns
を名前空間に等しく設定し、その値を取り除きます。
xmlns = '{http://foo.namespaceinfo.com}'
def etree_to_dict(t):
if xmlns in t.tag:
t.tag = t.tag.lstrip(xmlns)
if d = {t.tag : map(etree_to_dict, t.iterchildren())}
d.update(('@' + k, v) for k, v in t.attrib.iteritems())
d['text'] = t.text
return d