ASCII Haeufigkeiten
-
Hallo Leute
Ich muss fuer die uni eine Huffman-kompression schreiben die ASCII Text komprimiert.
Klapt auch alles ganz gut NUR:Ich finde keine Tabelle zur Haeufigkeit der (ALLER) ASCII-Zeichen im bezug auf das Vorkommen in der Deutschen /bzw. englischen Sprache.
Das muesset dann etwa so aussehen:
a = 1,66%
A = 2,76%
.
... ALLE ASCII Zeichen.
.
$ = 0,12%Wo kann ich so was finden?
Danke schon mal...ich hab ei Google etc. nur das Alphabet gefunden (das allein uetzt mir aber nichts
)
-
Wurde bei der Huffmankompression nicht die Häufigkeit innerhalb des zu komprimierenden Texttest verwendet?
-
Die Häufigkeiten der Zeichen kann man nicht vereinheitlichen.
Je nachdem, ob du ein wissenschaftliches Dokument, einen normalen Durchschnittsroman, die Bibel, das deutsche Strafgesetzbuch oder den Auszug eines Chatraums analysierst, wirst du wohl unterschiedliche Häufigkeiten erhalten.
Also solltest du dir einfach einen längeren Sampletext vornehmen und dann die einzelnen Vorkommen der Zeichen zählen.Wurde bei der Huffmankompression nicht die Häufigkeit innerhalb des zu komprimierenden Texttest verwendet?
Dann muss man aber den Baum mit abspeichern, was bei sehr kurzen Texten keinen Sinn machen würde.
-
geneu das mit den verschieden texten war mir klar. deshalb dachte ich es gab mal einen sprachforscher der die DURCHSCHNITTLICHE haeufigkeit aller ascii zeichen in der deutschen/englischen sprache analysiert hat.
Im grunde will ich nur einen guten allgemeingueltigen wert haben, um ihn fuer die codetabelle, die dann statisch verwendet wird zu verwenden.
Ich habe nicht das sprachfachwissen um mir aus "n" texten alle haeufigkeiten zu errechenn. Ich wuerde bestiimt etwas vergessen (z.b gesetzes texte... abkuerzungen mit punkten am ende etc).
aber sprachwissenschaftler sollten doch so was schon mal erstellt haben..oder?ein ststischer guter huffmancode verlangt doch genau danach (ich will ja nur ascii...kein unicode
)Wohin kann ich mich wenden um eine solche tabelle zu finden?