如何从XML字符串中加载org.w3c.dom.Document?

时间:2020-03-05 18:44:39  来源:igfitidea点击:

我在字符串中有一个完整的XML文档,并且想要一个Document对象。 Google会产生各种垃圾。什么是最简单的解决方案? (在Java 1.5中)

解决方案感谢Matt McMinn,我决定完成此实现。对我来说,它具有适当级别的输入灵活性和异常粒度。 (很高兴知道错误是来自格式错误的XMLSAXException还是仅来自错误的IOIOException。)

public static org.w3c.dom.Document loadXMLFrom(String xml)
    throws org.xml.sax.SAXException, java.io.IOException {
    return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes()));
}

public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is) 
    throws org.xml.sax.SAXException, java.io.IOException {
    javax.xml.parsers.DocumentBuilderFactory factory =
        javax.xml.parsers.DocumentBuilderFactory.newInstance();
    factory.setNamespaceAware(true);
    javax.xml.parsers.DocumentBuilder builder = null;
    try {
        builder = factory.newDocumentBuilder();
    }
    catch (javax.xml.parsers.ParserConfigurationException ex) {
    }  
    org.w3c.dom.Document doc = builder.parse(is);
    is.close();
    return doc;
}

解决方案

回答

在Java 1.5中,这对我有效,我从可读性中剔除了特定的异常。

import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.parsers.DocumentBuilder;
import org.w3c.dom.Document;
import java.io.ByteArrayInputStream;

public Document loadXMLFromString(String xml) throws Exception
{
    DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();

    factory.setNamespaceAware(true);
    DocumentBuilder builder = factory.newDocumentBuilder();

    return builder.parse(new ByteArrayInputStream(xml.getBytes()));
}

回答

哇!

此代码可能存在严重的问题,因为它会忽略String中指定的字符编码(默认情况下为UTF-8)。当我们调用String.getBytes()时,平台默认编码用于将Unicode字符编码为字节。因此,解析器可能认为它实际上正在获取UTF-8数据,而实际上它正在获取EBCDIC或者不漂亮的东西!

相反,使用带InputSource的parse方法,可以使用Reader构造它,如下所示:

import java.io.StringReader;
import org.xml.sax.InputSource;
…
        return builder.parse(new InputSource(new StringReader(xml)));

看起来似乎没什么大不了,但是对字符编码问题的无知导致了类似于y2k的隐匿代码腐烂。

回答

只是有一个类似的问题,除了我需要一个NodeList而不是一个Document,这就是我的想法。它与以前的解决方案基本相同,但经过增强后可以将根元素作为NodeList删除,并使用erickson的建议使用InputSource代替字符编码问题。

private String DOC_ROOT="root";
String xml=getXmlString();
Document xmlDoc=loadXMLFrom(xml);
Element template=xmlDoc.getDocumentElement();
NodeList nodes=xmlDoc.getElementsByTagName(DOC_ROOT);

public static Document loadXMLFrom(String xml) throws Exception {
        InputSource is= new InputSource(new StringReader(xml));
        DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
        factory.setNamespaceAware(true);
        DocumentBuilder builder = null;
        builder = factory.newDocumentBuilder();
        Document doc = builder.parse(is);
        return doc;
    }