<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[HTML-Seite parsen]]></title><description><![CDATA[<p>Hallo,</p>
<p>ich habe vor, ein Programm zu schreiben, welches mir eine HTML-Seite nach Links und verschiedenen Tags durchparst, und diese in einer Variable speichert.<br />
Das parsen will ich mit einer Regex erledigen, doch leider habe ich keine Ahnung wie das in C++ funktionieren soll. Habe zwar mal gegooglet und regex++ gefunden, doch irgendwie steige ich da nicht durch.</p>
<p>Mein Ziel ist es, das ich einfach die HTML-Seite als string habe, dann eine regex drüberlaufen lasse, und überall da wo die Regex zutrifft, dieser Teil soll dann in ein array gespeichert werden. (siehe <a href="http://de3.php.net/manual/en/function.preg-match.php" rel="nofollow">http://de3.php.net/manual/en/function.preg-match.php</a>)<br />
Wie könnte das funktionieren?</p>
<p>Des Weiteren hätte ich noch gerne ein Klasse, welche mir eine url als string, in ihre einzelne Bestandteile unterteilt und in ein array schreibt. Wisst ihr da was?(siehe <a href="http://de3.php.net/manual/en/function.parse-url.php" rel="nofollow">http://de3.php.net/manual/en/function.parse-url.php</a> ) <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f603.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--grinning_face_with_big_eyes"
      title=":D"
      alt="😃"
    /></p>
<p>Ich hoffe ihr könnt mir weiterhelfen.<br />
Grüsse Hegelbock</p>
]]></description><link>https://www.c-plusplus.net/forum/topic/162468/html-seite-parsen</link><generator>RSS for Node</generator><lastBuildDate>Sat, 12 Sep 2026 14:18:08 GMT</lastBuildDate><atom:link href="https://www.c-plusplus.net/forum/topic/162468.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 18 Oct 2006 20:49:41 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to HTML-Seite parsen on Wed, 18 Oct 2006 20:49:41 GMT]]></title><description><![CDATA[<p>Hallo,</p>
<p>ich habe vor, ein Programm zu schreiben, welches mir eine HTML-Seite nach Links und verschiedenen Tags durchparst, und diese in einer Variable speichert.<br />
Das parsen will ich mit einer Regex erledigen, doch leider habe ich keine Ahnung wie das in C++ funktionieren soll. Habe zwar mal gegooglet und regex++ gefunden, doch irgendwie steige ich da nicht durch.</p>
<p>Mein Ziel ist es, das ich einfach die HTML-Seite als string habe, dann eine regex drüberlaufen lasse, und überall da wo die Regex zutrifft, dieser Teil soll dann in ein array gespeichert werden. (siehe <a href="http://de3.php.net/manual/en/function.preg-match.php" rel="nofollow">http://de3.php.net/manual/en/function.preg-match.php</a>)<br />
Wie könnte das funktionieren?</p>
<p>Des Weiteren hätte ich noch gerne ein Klasse, welche mir eine url als string, in ihre einzelne Bestandteile unterteilt und in ein array schreibt. Wisst ihr da was?(siehe <a href="http://de3.php.net/manual/en/function.parse-url.php" rel="nofollow">http://de3.php.net/manual/en/function.parse-url.php</a> ) <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f603.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--grinning_face_with_big_eyes"
      title=":D"
      alt="😃"
    /></p>
<p>Ich hoffe ihr könnt mir weiterhelfen.<br />
Grüsse Hegelbock</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1157327</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1157327</guid><dc:creator><![CDATA[hegelbock]]></dc:creator><pubDate>Wed, 18 Oct 2006 20:49:41 GMT</pubDate></item><item><title><![CDATA[Reply to HTML-Seite parsen on Wed, 18 Oct 2006 20:57:27 GMT]]></title><description><![CDATA[<p>Vllt. hilft dir folgende Kurzeinführung (ist glaube ich teilweise von der Einführung in die regex Sachen von <a href="http://boost.org" rel="nofollow">boost.org</a>):<br />
<a href="http://cplus.kompf.de/artikel/regex.html" rel="nofollow">http://cplus.kompf.de/artikel/regex.html</a><br />
Da parst der in einem Beispiel auch HTML-Tags.<br />
Finde das nicht schwer zu bedienen, zumindest wenn man sich etwas mit RegEx aufkennt.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1157331</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1157331</guid><dc:creator><![CDATA[Vellas]]></dc:creator><pubDate>Wed, 18 Oct 2006 20:57:27 GMT</pubDate></item><item><title><![CDATA[Reply to HTML-Seite parsen on Wed, 18 Oct 2006 20:59:53 GMT]]></title><description><![CDATA[<p>hegelbock schrieb:</p>
<blockquote>
<p>Mein Ziel ist es, das ich einfach die HTML-Seite als string habe, dann eine regex drüberlaufen lasse, und überall da wo die Regex zutrifft, dieser Teil soll dann in ein array gespeichert werden. (siehe <a href="http://de3.php.net/manual/en/function.preg-match.php" rel="nofollow">http://de3.php.net/manual/en/function.preg-match.php</a>)<br />
Wie könnte das funktionieren?</p>
</blockquote>
<p>Du kannst einfach die ganze Seite in ein std::string-Objekt einlesen und dann nach den entsprechenen Schlüsselworten mit der find-Methode suchen. Dabei musst du nur immer das neue Offset angeben, damit er bei nem Fund nicht wieder von vorne beginnt...aber das ja auch irgendwie klaro <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f609.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--winking_face"
      title=";)"
      alt="😉"
    /> .</p>
<p>hegelbock schrieb:</p>
<blockquote>
<p>Des Weiteren hätte ich noch gerne ein Klasse, welche mir eine url als string, in ihre einzelne Bestandteile unterteilt und in ein array schreibt. Wisst ihr da was?(siehe <a href="http://de3.php.net/manual/en/function.parse-url.php" rel="nofollow">http://de3.php.net/manual/en/function.parse-url.php</a> ) <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f603.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--grinning_face_with_big_eyes"
      title=":D"
      alt="😃"
    /></p>
</blockquote>
<p>Auch das kannst du mit den oben gannten Methoden lösen, guck dir einfach mal die Klasse std::string an ( <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/27a1.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--right_arrow"
      title=":arrow_right:"
      alt="➡"
    /> <a href="http://cppreference.com/cppstring/index.html" rel="nofollow">http://cppreference.com/cppstring/index.html</a>).</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1157333</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1157333</guid><dc:creator><![CDATA[CodeFinder]]></dc:creator><pubDate>Wed, 18 Oct 2006 20:59:53 GMT</pubDate></item><item><title><![CDATA[Reply to HTML-Seite parsen on Thu, 19 Oct 2006 12:15:37 GMT]]></title><description><![CDATA[<p><a class="plugin-mentions-user plugin-mentions-a" href="https://www.c-plusplus.net/forum/uid/3227">@Vellas</a><br />
Ok, das ist schonmal sehr praktisch. Habe dieses auch direkt mal installiert, doch irgendwie bekomme ich Fehlermeldungen. (Und zwar sobald ich eine Instanz von regex erzeuge) An was könnte das liegen?<br />
Hier der Code und die Fehlermeldung:</p>
<pre><code class="language-cpp">#include &lt;boost/regex.hpp&gt;
using namespace boost;

int main()
{
   static const boost::regex e(&quot;\\u{1,3}-\\u{1,2} \\d{1,4}[ \\0]*&quot;);
  return 0;
}
</code></pre>
<p>Um dies zu kompilieren führe ich folgenden Befehl aus:<br />
g++ -I/sw/include -L/sw/lib regex.cpp</p>
<p>Meldung:</p>
<pre><code>/usr/bin/ld: Undefined symbols:
boost::basic_regex&lt;char, boost::regex_traits&lt;char, boost::cpp_regex_traits&lt;char&gt; &gt; &gt;::do_assign(char const*, char const*, unsigned int)
collect2: ld returned 1 exit status
</code></pre>
]]></description><link>https://www.c-plusplus.net/forum/post/1157613</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1157613</guid><dc:creator><![CDATA[hegelbock]]></dc:creator><pubDate>Thu, 19 Oct 2006 12:15:37 GMT</pubDate></item></channel></rss>