<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[links aus HTML-quelltext extrahieren]]></title><description><![CDATA[<p>Moin moin,</p>
<p>ich versuche alle links aus einem html-quelltext zu extrahieren. Meine funktion sieht so aus:</p>
<pre><code class="language-cpp">vector &lt;string&gt; found;

void find(string quelltext)
{
    string link, src; 
    int pos, pos2;

   while(quelltext.find(&quot;href=\&quot;&quot;) != -1)
    {
    pos = quelltext.find(&quot;href=\&quot;&quot;);
    quelltext = quelltext.substr(pos+6, quelltext.length());

    pos2 = quelltext.find(&quot;\&quot;&quot;);
    link = quelltext.substr(0,pos2);

    if(std::find(found.begin(), found.end(),link) == found.end() )
    {
       cout&lt;&lt;link&lt;&lt;endl&lt;&lt;endl;
       found.push_back(link);

      src = GetSource(link);
      if(src != &quot;&quot;)

    }  

   quelltext = quelltext.substr(pos, quelltext.length()); 
  }
}
</code></pre>
<p>Leider werden nicht alle links angezeigt. Kann mir jemand sagen, wo der fehler liegt oder mir einen andere funktion geben ?</p>
<p>Danke, <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f44d.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--thumbs_up"
      title=":+1:"
      alt="👍"
    /><br />
Wiesel</p>
]]></description><link>https://www.c-plusplus.net/forum/topic/261529/links-aus-html-quelltext-extrahieren</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 05:33:19 GMT</lastBuildDate><atom:link href="https://www.c-plusplus.net/forum/topic/261529.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 19 Feb 2010 17:21:27 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to links aus HTML-quelltext extrahieren on Fri, 19 Feb 2010 17:21:27 GMT]]></title><description><![CDATA[<p>Moin moin,</p>
<p>ich versuche alle links aus einem html-quelltext zu extrahieren. Meine funktion sieht so aus:</p>
<pre><code class="language-cpp">vector &lt;string&gt; found;

void find(string quelltext)
{
    string link, src; 
    int pos, pos2;

   while(quelltext.find(&quot;href=\&quot;&quot;) != -1)
    {
    pos = quelltext.find(&quot;href=\&quot;&quot;);
    quelltext = quelltext.substr(pos+6, quelltext.length());

    pos2 = quelltext.find(&quot;\&quot;&quot;);
    link = quelltext.substr(0,pos2);

    if(std::find(found.begin(), found.end(),link) == found.end() )
    {
       cout&lt;&lt;link&lt;&lt;endl&lt;&lt;endl;
       found.push_back(link);

      src = GetSource(link);
      if(src != &quot;&quot;)

    }  

   quelltext = quelltext.substr(pos, quelltext.length()); 
  }
}
</code></pre>
<p>Leider werden nicht alle links angezeigt. Kann mir jemand sagen, wo der fehler liegt oder mir einen andere funktion geben ?</p>
<p>Danke, <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f44d.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--thumbs_up"
      title=":+1:"
      alt="👍"
    /><br />
Wiesel</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1858314</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1858314</guid><dc:creator><![CDATA[Wiesel667]]></dc:creator><pubDate>Fri, 19 Feb 2010 17:21:27 GMT</pubDate></item><item><title><![CDATA[Reply to links aus HTML-quelltext extrahieren on Fri, 19 Feb 2010 17:42:23 GMT]]></title><description><![CDATA[<pre><code class="language-cpp">vector &lt;string&gt; found;

void find(string quelltext)
{
    string link, src; 
    int pos, pos2;

   while( (pos = quelltext.find(&quot;href=\&quot;&quot;)) != -1) 
    {
    quelltext = quelltext.substr(pos+6, quelltext.length());

    pos2 = quelltext.find(&quot;\&quot;&quot;);
    link = quelltext.substr(0,pos2);

    if(std::find(found.begin(), found.end(),link) == found.end() )
    {
       cout&lt;&lt;link&lt;&lt;endl&lt;&lt;endl;
       found.push_back(link);

      src = GetSource(link);
      if(src != &quot;&quot;)

    }  

   quelltext = quelltext.substr(pos, quelltext.length()); 
  }
}
</code></pre>
<p>Versuchs jetzt mal, mehr kann ich auch nicht sagen. Ich weiß nicht wie deine Klasse definiert ist...</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1858327</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1858327</guid><dc:creator><![CDATA[DerSpacken]]></dc:creator><pubDate>Fri, 19 Feb 2010 17:42:23 GMT</pubDate></item><item><title><![CDATA[Reply to links aus HTML-quelltext extrahieren on Fri, 19 Feb 2010 19:08:35 GMT]]></title><description><![CDATA[<p>Machs doch mit regulären Ausdrücken (Boost::Regex)</p>
<p>Vereinfach die Abdeckung von spaces, weil dein code würde</p>
<pre><code>&lt;a href = &quot;http://web.de/&quot;&gt;link&lt;/a&gt;
</code></pre>
<p>nicht erkennen - die spaces um das &quot;=&quot; verhindern das ...</p>
<p>mfg Branleb</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1858376</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1858376</guid><dc:creator><![CDATA[branleb]]></dc:creator><pubDate>Fri, 19 Feb 2010 19:08:35 GMT</pubDate></item><item><title><![CDATA[Reply to links aus HTML-quelltext extrahieren on Fri, 19 Feb 2010 21:27:07 GMT]]></title><description><![CDATA[<pre><code class="language-cpp">#include &lt;iostream&gt;
#include &lt;string&gt;
#include &lt;vector&gt;

typedef std::vector&lt;std::string&gt; StrVector;

StrVector find(const std::string&amp; source);

int main()
{
	const std::string source = &quot;&lt;a href\n=\n\&quot;www.test.de\&quot;&gt;Bla&lt;/a&gt;&lt;a href\n=\n\&quot;www.test2.de\&quot;&gt;Bla&lt;/a&gt;&lt;a href\n=\n\&quot;www.12312.de\&quot;  &gt;Bla&lt;/a&gt;&quot;;

	StrVector links = find(source);

	std::cout &lt;&lt; &quot;Found &quot; &lt;&lt; links.size() &lt;&lt; &quot; link(s)\n\n&quot;;

	for (StrVector::iterator it = links.begin(); it != links.end(); ++it)
	{
		std::cout &lt;&lt; *it &lt;&lt; std::endl;
	}
}

StrVector find(const std::string&amp; source)
{
	StrVector vec;

	size_t pos = 0;

	while ((pos = source.find(&quot;href&quot;, pos + 1)) != std::string::npos)
	{
		for (unsigned int i = pos; i &lt; source.length(); ++i)
		{
			if (source[i] == '&quot;')
			{
				std::string buf;

				++i;

				while (source[i] != '&quot;' &amp;&amp; i &lt; source.length())
				{
					buf += source[i++];
				}

				vec.push_back(buf);

				break;
			}
		}
	}

	return vec;
}
</code></pre>
]]></description><link>https://www.c-plusplus.net/forum/post/1858429</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1858429</guid><dc:creator><![CDATA[ghjghj]]></dc:creator><pubDate>Fri, 19 Feb 2010 21:27:07 GMT</pubDate></item><item><title><![CDATA[Reply to links aus HTML-quelltext extrahieren on Sat, 20 Feb 2010 11:16:34 GMT]]></title><description><![CDATA[<p>Regular Expressions helfen bei solchen Sachen auch immer recht gut, wenn man etwas komplexere Suchpatterns hat.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1858536</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1858536</guid><dc:creator><![CDATA[drakon]]></dc:creator><pubDate>Sat, 20 Feb 2010 11:16:34 GMT</pubDate></item></channel></rss>