Извлечение текста из HTML Java

Я работаю над программой, которая загружает HTML-страницы, а затем выбирает часть информации и записывает ее в другой файл.

Я хочу извлечь информацию, которая находится между тегами абзаца, но я могу получить только одну строку абзаца. Мой код выглядит следующим образом:

FileReader fileReader = new FileReader(file);
BufferedReader buffRd = new BufferedReader(fileReader);
BufferedWriter out = new BufferedWriter(new FileWriter(newFile.txt));
String s;

while ((s = br.readLine()) !=null) {
    if(s.contains("<p>")) {
        try {
            out.write(s);
        } catch (IOException e) {
        }
    }
}

я пытался добавить еще один цикл while, который сообщал бы программе, что нужно продолжать запись в файл до тех пор, пока строка не будет содержать тег , говоря:

while ((s = br.readLine()) !=null) {
    if(s.contains("<p>")) {
        while(!s.contains("</p>") {
            try {
                out.write(s);
            } catch (IOException e) {
            }
        }
    }
}

Но это не работает. Может ли кто-нибудь помочь.

Community 06.09.2009 источник

comment

Мы определенно наблюдаем ошибку в экранировании HTML-тегов SO. - Yishai 06.09.2009

comment

Вы цитируете их как код с обратными кавычками? - pjp 06.09.2009

comment

Парсеры HTML существуют, и их очень много. - 06.09.2009

Ответы (8)

arrow_upward
32
arrow_downward

jsoup

Еще один синтаксический анализатор html, который мне очень понравился, был jsoup. Вы можете получить все элементы  в 2 строчках кода.

Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
Elements ps = doc.select("p");

Затем запишите это в файл еще одной строкой

out.write(ps.text());  //it will append all of the p elements together in one long string

или, если вы хотите, чтобы они были в отдельных строках, вы можете перебирать элементы и записывать их отдельно.

Danny 23.04.2012

comment

Если в документе не используются теги p (несемантическая разметка), я предполагаю, что это не сработает. - sinθ; 15.06.2014

comment

@ sinθ Вопрос явно запрашивал p элементов. Это абсолютно правильный ответ. - Basil Bourque; 26.06.2014

comment

Спасибо, @Danny, я ♥ этот суп! - frogatto; 06.01.2015

arrow_upward
10
arrow_downward

jericho - один из нескольких возможных синтаксических анализаторов HTML, которые могут сделать эту задачу простой и безопасной.

Gareth Davis 06.09.2009

arrow_upward
4
arrow_downward

JTidy может представлять HTML-документ (даже искаженный) в качестве модели документа, делая процесс извлечения содержимое тега  - более элегантный процесс, чем просмотр необработанного текста вручную.

skaffman 06.09.2009

arrow_upward
0
arrow_downward

Мне удалось использовать TagSoup и XPath для анализа HTML.

http://home.ccil.org/~cowan/XML/tagsoup/

Billy Bob Bain 06.09.2009

arrow_upward
0
arrow_downward

Используйте ParserCallback. Это простой класс, включенный в JDK. Он уведомляет вас каждый раз, когда обнаруживается новый тег, а затем вы можете извлечь текст тега. Простой пример:

import java.io.*;
import java.net.*;
import javax.swing.text.*;
import javax.swing.text.html.*;
import javax.swing.text.html.parser.*;

public class ParserCallbackTest extends HTMLEditorKit.ParserCallback
{
    private int tabLevel = 1;
    private int line = 1;

    public void handleComment(char[] data, int pos)
    {
        displayData(new String(data));
    }

    public void handleEndOfLineString(String eol)
    {
        System.out.println( line++ );
    }

    public void handleEndTag(HTML.Tag tag, int pos)
    {
        tabLevel--;
        displayData("/" + tag);
    }

    public void handleError(String errorMsg, int pos)
    {
        displayData(pos + ":" + errorMsg);
    }

    public void handleMutableTag(HTML.Tag tag, MutableAttributeSet a, int pos)
    {
        displayData("mutable:" + tag + ": " + pos + ": " + a);
    }

    public void handleSimpleTag(HTML.Tag tag, MutableAttributeSet a, int pos)
    {
        displayData( tag + "::" + a );
//      tabLevel++;
    }

    public void handleStartTag(HTML.Tag tag, MutableAttributeSet a, int pos)
    {
        displayData( tag + ":" + a );
        tabLevel++;
    }

    public void handleText(char[] data, int pos)
    {
        displayData( new String(data) );
    }

    private void displayData(String text)
    {
        for (int i = 0; i < tabLevel; i++)
            System.out.print("\t");

        System.out.println(text);
    }

    public static void main(String[] args)
    throws IOException
    {
        ParserCallbackTest parser = new ParserCallbackTest();

        // args[0] is the file to parse

        Reader reader = new FileReader(args[0]);
//      URLConnection conn = new URL(args[0]).openConnection();
//      Reader reader = new InputStreamReader(conn.getInputStream());

        try
        {
            new ParserDelegator().parse(reader, parser, true);
        }
        catch (IOException e)
        {
            System.out.println(e);
        }
    }
}

Итак, все, что вам нужно сделать, это установить логический флаг при обнаружении тега абзаца. Затем в методе handleText () вы извлекаете текст.

camickr 06.09.2009

arrow_upward
0
arrow_downward

Попробуй это.

 public static void main( String[] args )
{
    String url = "http://en.wikipedia.org/wiki/Big_data";

    Document document;
    try {
        document = Jsoup.connect(url).get();
        Elements paragraphs = document.select("p");

        Element firstParagraph = paragraphs.first();
        Element lastParagraph = paragraphs.last();
        Element p;
        int i=1;
        p=firstParagraph;
        System.out.println("*  " +p.text());
        while (p!=lastParagraph){
            p=paragraphs.get(i);
            System.out.println("*  " +p.text());
            i++;
        } 
} catch (IOException e) {
    // TODO Auto-generated catch block
    e.printStackTrace();
}
}

Consultant 20.06.2013

comment

Что это за «Элемент» и «Документ». Это какой-нибудь сторонний парсер? Показать также строки импорта - James; 29.08.2017

arrow_upward
-1
arrow_downward

Попробуйте (если вы не хотите использовать библиотеку парсера HTML):


        FileReader fileReader = new FileReader(file);
        BufferedReader buffRd = new BufferedReader(fileReader);
        BufferedWriter out = new BufferedWriter(new FileWriter(newFile.txt));
        String s;
        int writeTo = 0;
        while ((s = br.readLine()) !=null) 
        {
                if(s.contains("<p>"))
                {
                        writeTo = 1;

                        try 
                        {
                            out.write(s);
                    } 
                        catch (IOException e) 
                        {

                    }
                }
                if(s.contains("</p>"))
                {
                        writeTo = 0;

                        try 
                        {
                            out.write(s);
                    } 
                        catch (IOException e) 
                        {

                    }
                }
                else if(writeTo==1)
                {
                        try 
                        {
                            out.write(s);
                    } 
                        catch (IOException e) 
                        {

                    }
                }
}

Niall 06.09.2009

comment

Что произойдет, если  и  находятся на одной линии? В этом случае строка будет записана дважды. Я думаю, это действительно зависит от ввода. - pjp; 06.09.2009

comment

Вы можете добавить некоторое состояние, чтобы увидеть, написали ли вы уже строку, прежде чем записывать ее снова. - pjp; 06.09.2009

arrow_upward
-3
arrow_downward

Возможно, вы просто используете неподходящий инструмент для работы:

perl -ne "print if m|<p>| .. m|</p>|" infile.txt >outfile.txt

brianary 06.09.2009

comment

Это честный полицейский. Впрочем, своего рода поздний хит. - brianary; 26.12.2009

Извлечение текста из HTML Java

Ответы (8)

jsoup

Похожие вопросы