GI LogoGI Logo
  • Anmelden
Digitale Bibliothek
    • Gesamter Bestand

      • Bereiche & Sammlungen
      • Titel
      • Autor
      • Erscheinungsdatum
      • Schlagwort
    • Diese Sammlung

      • Titel
      • Autor
      • Erscheinungsdatum
      • Schlagwort
Digital Bibliothek der Gesellschaft für Informatik e.V.
GI-DL
    • English
    • Deutsch
  • Deutsch 
    • English
    • Deutsch
Dokumentanzeige 
  •   Startseite
  • Lecture Notes in Informatics
  • Dissertations
  • D09 (2010) - Ausgezeichnete Informatikdissertationen
  • Dokumentanzeige
JavaScript is disabled for your browser. Some features of this site may not work without it.
  •   Startseite
  • Lecture Notes in Informatics
  • Dissertations
  • D09 (2010) - Ausgezeichnete Informatikdissertationen
  • Dokumentanzeige

Content Extraction: Bestimmung des Hauptinhaltes in HTML Dokumenten

Autor(en):
Gottron, Thomas [DBLP]
Zusammenfassung
Außer dem Artikel der den eigentlichen Hauptinhalt darstellt enthalten die meisten HTML Dokumente im WWW zusätzliche Inhalte, wie beispielsweise Navigationsmenüs, gestalterische Elemente oder Werbung. Für verschiedene Anwendungen ist es nötig die Unterscheidung zwischen Haupt- und zusätzlichen Inhalten automatisch vorzunehmen. Content Extraction und Template Detection sind Verfahren, die diese Aufgabe lösen. Während der Forschungsarbeit auf diesem Gebiet sind einige interessante Beiträge entstanden. Drei davon sollen hier kurz vorgestellt werden. Dazu gehört der neu eingeführte Content Code Blurring Algorithmus, derzeit der leistungsfähigste Ansatz zur Inhaltsextraktion. Der zweite Beitrag liegt in der Entwicklung objektiver Maße zur Bewertung der Leistung von Algorithmen zur Inhaltsextraktion. Dadurch ließen sich bestehende Verfahren erstmals überhaupt miteinander vergleichen. Eine Analyse verschiedener Methoden zur Gruppierung von Webdokumenten bezüglich der ihnen unterliegenden Templates stellt den dritten größeren Beitrag dieser Arbeit dar. In Kombination mit einer lokalen Websuche kann dieses Templateclustering für die automatische Erstellung von Trainingsdatensätzen zur Templateerkennung eingesetzt werden. Da das Verfahren vollautomatisch ablaufen kann, ermöglicht es im Prinzip Template Detection auf einzelne Dokumente anzuwenden. Damit lassen sich die Vorteile aus Content Extraction und Template Detection verknüpfen.
  • Vollständige Referenz
  • BibTeX
Gottron, T., (2009). Content Extraction: Bestimmung des Hauptinhaltes in HTML Dokumenten. In: Hölldobler, S. & , . (Hrsg.), Ausgezeichnete Informatikdissertationen 2008. Bonn: Gesellschaft für Informatik. (S. 101-110).
@inproceedings{mci/Gottron2009,
author = {Gottron, Thomas},
title = {Content Extraction: Bestimmung des Hauptinhaltes in HTML Dokumenten},
booktitle = {Ausgezeichnete Informatikdissertationen 2008},
year = {2009},
editor = {Hölldobler, Steffen AND et al.} ,
pages = { 101-110 },
publisher = {Gesellschaft für Informatik},
address = {Bonn}
}
DateienGroesseFormatAnzeige
101.pdf171.4Kb PDF Öffnen

Haben Sie fehlerhafte Angaben entdeckt? Sagen Sie uns Bescheid: Feedback abschicken

Mehr Information

ISBN: 978-3-88579-413-4
ISSN: 1617-5468
Datum: 2009
Sprache: de (de)
Sammlungen
  • D09 (2010) - Ausgezeichnete Informatikdissertationen [36]

Zur Langanzeige


Über uns | FAQ | Hilfe | Impressum | Datenschutz

Gesellschaft für Informatik e.V. (GI), Kontakt: Geschäftsstelle der GI
Diese Digital Library basiert auf DSpace.

 

 


Über uns | FAQ | Hilfe | Impressum | Datenschutz

Gesellschaft für Informatik e.V. (GI), Kontakt: Geschäftsstelle der GI
Diese Digital Library basiert auf DSpace.