ElementTreeを使用してXMLを辞書に変換する

Question

ElementTreeを使用してXMLから辞書へのパーサーを探しています。すでにいくつかは見つかりましたが、それらは属性を除外しており、私の場合はたくさんの属性があります。

Fred Foo · Accepted Answer

def etree_to_dict(t): d = {t.tag : map(etree_to_dict, t.iterchildren())} d.update(('@' + k, v) for k, v in t.attrib.iteritems()) d['text'] = t.text return d

として呼び出す

tree = etree.parse("some_file.xml") etree_to_dict(tree.getroot())

これは、実際に属性textがない限り機能します。その場合は、関数本体の3行目を変更して別のキーを使用してください。また、これでは混合コンテンツを処理できません。

（LXMLでテスト済み。）

K3---rnc · Answer

次のXML-to-Python-dictスニペットは、エンティティと、このXML-to-JSON "仕様" に続く属性を解析します。

from collections import defaultdict def etree_to_dict(t): d = {t.tag: {} if t.attrib else None} children = list(t) if children: dd = defaultdict(list) for dc in map(etree_to_dict, children): for k, v in dc.items(): dd[k].append(v) d = {t.tag: {k: v[0] if len(v) == 1 else v for k, v in dd.items()}} if t.attrib: d[t.tag].update(('@' + k, v) for k, v in t.attrib.items()) if t.text: text = t.text.strip() if children or t.attrib: if text: d[t.tag]['#text'] = text else: d[t.tag] = text return d

使用されます：

from xml.etree import cElementTree as ET e = ET.XML(''' <root> <e /> <e>text</e> <e name="value" /> <e name="value">text</e> <e> <a>text</a> <b>text</b> </e> <e> <a>text</a> <a>text</a> </e> <e> text <a>text</a> </e> </root> ''') from pprint import pprint d = etree_to_dict(e) pprint(d)

この例の出力（上記のリンクされた「仕様」による）は次のようになります。

{'root': {'e': [None, 'text', {'@name': 'value'}, {'#text': 'text', '@name': 'value'}, {'a': 'text', 'b': 'text'}, {'a': ['text', 'text']}, {'#text': 'text', 'a': 'text'}]}}

必ずしもきれいではありませんが、それは明白であり、より単純なXML入力はより単純なJSONになります。 :)

更新

reverseを実行し、-JSON/dictからXML文字列を発行する場合は、次のように使用できます。

try: basestring except NameError: # python3 basestring = str def dict_to_etree(d): def _to_etree(d, root): if not d: pass Elif isinstance(d, str): root.text = d Elif isinstance(d, dict): for k,v in d.items(): assert isinstance(k, str) if k.startswith('#'): assert k == '#text' and isinstance(v, str) root.text = v Elif k.startswith('@'): assert isinstance(v, str) root.set(k[1:], v) Elif isinstance(v, list): for e in v: _to_etree(e, ET.SubElement(root, k)) else: _to_etree(v, ET.SubElement(root, k)) else: assert d == 'invalid type', (type(d), d) assert isinstance(d, dict) and len(d) == 1 tag, body = next(iter(d.items())) node = ET.Element(tag) _to_etree(body, node) return node print(ET.tostring(dict_to_etree(d)))

s29 · Answer

@larsmansに基づいて、属性が必要ない場合、これにより、よりタイトな辞書が得られます-

def etree_to_dict(t): return {t.tag : map(etree_to_dict, t.iterchildren()) or t.text}

albarji · Answer

python辞書から/にXMLを変換する場合、 xmltodict は私にとってはうまくいきました：

import xmltodict xml = ''' <root> <e /> <e>text</e> <e name="value" /> <e name="value">text</e> <e> <a>text</a> <b>text</b> </e> <e> <a>text</a> <a>text</a> </e> <e> text <a>text</a> </e> </root> ''' xdict = xmltodict.parse(xml)

xdictは次のようになります

OrderedDict([('root', OrderedDict([('e', [None, 'text', OrderedDict([('@name', 'value')]), OrderedDict([('@name', 'value'), ('#text', 'text')]), OrderedDict([('a', 'text'), ('b', 'text')]), OrderedDict([('a', ['text', 'text'])]), OrderedDict([('a', 'text'), ('#text', 'text')])])]))])

XMLデータが未加工の文字列/バイト形式ではなく、ElementTreeオブジェクトにある場合は、それを文字列として出力し、xmldict.parseを再度使用するだけです。たとえば、lxmlを使用してXMLドキュメントを処理している場合、

from lxml import etree e = etree.XML(xml) xmltodict.parse(etree.tostring(e))

上記と同じ辞書を生成します。

Dean Christian Armada · Answer

XMLから辞書に直接変換するこのスニペットを使用できます

import xml.etree.ElementTree as ET xml = ('<xml>' + '<first_name>Dean Christian</first_name>' + '<middle_name>Christian</middle_name>' + '<last_name>Armada</last_name>' + '</xml>') root = ET.fromstring(xml) x = {x.tag: root.find(x.tag).text for x in root._children} # returns {'first_name': 'Dean Christian', 'last_name': 'Armada', 'middle_name': 'Christian'}

luismartingil · Answer

from lxml import etree, objectify def formatXML(parent): """ Recursive operation which returns a tree formated as dicts and lists. Decision to add a list is to find the 'List' Word in the actual parent tag. """ ret = {} if parent.items(): ret.update(dict(parent.items())) if parent.text: ret['__content__'] = parent.text if ('List' in parent.tag): ret['__list__'] = [] for element in parent: ret['__list__'].append(formatXML(element)) else: for element in parent: ret[element.tag] = formatXML(element) return ret

bloodrootfc · Answer

次に、xmlの単純なデータ構造を示します（file.xmlとして保存）。

<?xml version="1.0" encoding="UTF-8"?> <Data> <Person> <First>John</First> <Last>Smith</Last> </Person> <Person> <First>Jane</First> <Last>Doe</Last> </Person> </Data>

これから辞書オブジェクトのリストを作成するコードは次のとおりです。

from lxml import etree tree = etree.parse('file.xml') root = tree.getroot() datadict = [] for item in root: d = {} for elem in item: d[elem.tag]=elem.text datadict.append(d)

datadictには以下が含まれます：

[{'First': 'John', 'Last': 'Smith'},{'First': 'Jane', 'Last': 'Doe'}]

次のようにアクセスできます：

datadict[0]['First'] 'John' datadict[1]['Last'] 'Doe'

DaveL17 · Answer

@larsmansに基づいて構築し、結果のキーにxml名前空間情報が含まれている場合、dictに書き込む前にそれを削除できます。変数xmlnsを名前空間に等しく設定し、その値を取り除きます。

xmlns = '{http://foo.namespaceinfo.com}' def etree_to_dict(t): if xmlns in t.tag: t.tag = t.tag.lstrip(xmlns) if d = {t.tag : map(etree_to_dict, t.iterchildren())} d.update(('@' + k, v) for k, v in t.attrib.iteritems()) d['text'] = t.text return d