Spider bzw. in HTML Datei Metatag suchen



  • Hallo

    Ich bin gerade mal wieder an meinem Spider zu gange. Also ich habe folgendes Problem.
    Alles läuft bisher so:
    Seite wird runtergeladen und nach Links durchsucht danach werden die Links in einer Datenbank gespeichert und der nächste Link ist dran.
    Mein Prob ist jetzt das das mit den Links alles funzt aber nun kommt das nächste Problem: Die Metatags!
    Ich will jetzt auch noch die Metatags auslesen um genau zu sein die Keywords um später besser die Links in meinen Katalog einzupflgen. Aber wie mache ich das? Ein Typischer Metagtag wäre ja dieser:
    <meta name="keywords" content="key1, key2, key3,key4">
    Mein Problem sind eigentlich nur die " die da drinnen sind wäre die nicht wäre alles kein Problem.
    Ich lese eigentlich immer alles so aus:

    start = zeile.Find("href=");
    			if(start != -1)
    			{
    				start +=6;
    				end = zeile.Find('"',start);
    				zahl = end - start;
    				adresse = zeile.Mid(start,zahl);
    				http = adresse.Find("http://www");
    
    				if(http != -1){
    
    					m_url.AddString(adresse);
    				        eintragen();
    
    				}
    
    			}
    

    Was jetzt nicht mehr geht wegen den ganzen " da drinnen. Ich habe Probleme wowohl beim auslesen des ersten Teils und des auslesen des endes.

    Wäre gut wenn mir da einer mal eine Tipp geben könnte!

    MFG
    Jens



  • naja nichts leichter als das oder?
    bau dir ne neue funktion die nur die Metatags ausliest. in dieser suchste dann halt nicht nach anführungszeichen sondern nach pfeilen von < bis >. alles was dann zwischen von < bis > ausgegeben wird ist Metatag.

    kuck dir die stringfunction Mid mal genauer an 😉

    mfg
    LowFly



  • ach ich soll nach < suchen? na klar dann bekomme ich aber auch <br> <html> <a> usw!



  • Hi,
    macht nichts wenn du auch die anderen einliest, wenn dein tag nicht mit einem <meta beginnt, kannst ihn auch ignorieren, und um nicht wirklich alles lesen zu müssen
    kannst auch noch sagen das nur solange gelesen wird bis der </head> oder <body>
    gefunden wurde! Fallst du für das lesen der meta-tags eine eigene funktion schreibst!

    lg
    pixel



  • stimmt das mit dem </head> is ne gute idee



  • Hi,
    folgt dein spider den links oder parst du nur die eine seite die eingegeben wird?
    Vergiss nicht das es seiten gibt die kein <html> haben, die frames!
    Hast du da auch was gemacht?

    lg
    pixel


Anmelden zum Antworten