<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[unicode datei einlesen?]]></title><description><![CDATA[<p>hey,</p>
<p>ich schreib hier grad ein kleines tool, welches dump-files liest und analysiert.</p>
<p>bisher öffne ich die dateien mit fstream::open.</p>
<p>das problem is jetz, dass sich zwischen diesen dumpfiles auch files die unicode codiert sind, befinden.</p>
<p>jetz krieg ich natürlich nur hyroglyphen da raus, so wie ich das file jetzt lese.</p>
<p>was kann ich da machen?</p>
]]></description><link>https://www.c-plusplus.net/forum/topic/188908/unicode-datei-einlesen</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 05:07:24 GMT</lastBuildDate><atom:link href="https://www.c-plusplus.net/forum/topic/188908.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 06 Aug 2007 08:17:10 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 08:17:10 GMT]]></title><description><![CDATA[<p>hey,</p>
<p>ich schreib hier grad ein kleines tool, welches dump-files liest und analysiert.</p>
<p>bisher öffne ich die dateien mit fstream::open.</p>
<p>das problem is jetz, dass sich zwischen diesen dumpfiles auch files die unicode codiert sind, befinden.</p>
<p>jetz krieg ich natürlich nur hyroglyphen da raus, so wie ich das file jetzt lese.</p>
<p>was kann ich da machen?</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339371</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339371</guid><dc:creator><![CDATA[smuRf]]></dc:creator><pubDate>Mon, 06 Aug 2007 08:17:10 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 09:16:48 GMT]]></title><description><![CDATA[<p>hmm fstream ist meines Wissens die Spezialisierung von basic_fstream für char</p>
<pre><code class="language-cpp">std::basic_fstream&lt;wchar_t&gt;
</code></pre>
<p>sollte die Spezialisierung für Unicode sein, dürfte sich genauso verwenden lassen, wie</p>
<pre><code class="language-cpp">basic_fstream&lt;char&gt;
</code></pre>
<p>also &quot;fstream&quot; ...</p>
<p>aber keine Gewähr^^<br />
/Edit:<br />
Fehler ausgebessert</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339375</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339375</guid><dc:creator><![CDATA[Checker*amp*Murckser]]></dc:creator><pubDate>Mon, 06 Aug 2007 09:16:48 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 08:29:40 GMT]]></title><description><![CDATA[<p>Checker&amp;Murckser schrieb:</p>
<blockquote>
<p>hmm fstream ist meines Wissens die Spezialisierung von basic_fstream für char</p>
<pre><code class="language-cpp">std::basic_fstream&lt;wchar_t&gt;
</code></pre>
<p>sollte die Spezialisierung für Unicode sein</p>
</blockquote>
<p>Anmerkung: Damit du diesen Bandwurm nicht immer hinschreiben mußt, gibt es eine Kurzbezeichnung dafür: 'wfstream'</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339376</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339376</guid><dc:creator><![CDATA[CStoll]]></dc:creator><pubDate>Mon, 06 Aug 2007 08:29:40 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 09:32:59 GMT]]></title><description><![CDATA[<p>war glaub eh n Fehler bei mir drin:<br />
müsste es nicht heißen<br />
basic_fstream&lt;wchar_t, std::char_traits&lt;wchar_t&gt; &gt; ?</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339377</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339377</guid><dc:creator><![CDATA[Checker*amp*Murckser]]></dc:creator><pubDate>Mon, 06 Aug 2007 09:32:59 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 08:40:25 GMT]]></title><description><![CDATA[<p>hab das ganze jetz so</p>
<pre><code class="language-cpp">wfstream file;
wchar_t output[1000];

file.open(m_sourcefilename,ios::in);
file.getline(output , 999) ;
</code></pre>
<p>krieg da aber die selben sonderzeichen in den buffer, die ich auch bei der verwendung von fstream bekommen hab <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f61e.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--disappointed_face"
      title=":("
      alt="😞"
    /></p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339383</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339383</guid><dc:creator><![CDATA[smuRf]]></dc:creator><pubDate>Mon, 06 Aug 2007 08:40:25 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 08:44:21 GMT]]></title><description><![CDATA[<p>Checker&amp;Murckser schrieb:</p>
<blockquote>
<p>war glaub eh n Fehler bei mir drin:<br />
müsste es nicht heißen<br />
basic_fstream&lt;char, std::char_traits&lt;wchar_t&gt; &gt; ?</p>
</blockquote>
<p>Nein, basic_fstream&lt;wchar_t&gt; war schon richtig (und im Einsatz sollte der Traits-Typ schon zum Zeichentyp passen, sonst hagelt's Probleme ;))</p>
<p>Edit <a class="plugin-mentions-user plugin-mentions-a" href="https://www.c-plusplus.net/forum/uid/16910">@Smurf</a>: Es kann auch sein, daß du eine Unicode-taugliche codecvt&lt;&gt; Facette zusammenbauen und deinem Stream übergeben mußt, damit er vernünftig arbeitet.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339385</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339385</guid><dc:creator><![CDATA[CStoll]]></dc:creator><pubDate>Mon, 06 Aug 2007 08:44:21 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 08:48:09 GMT]]></title><description><![CDATA[<p>smuRf schrieb:</p>
<blockquote>
<p>krieg da aber die selben sonderzeichen in den buffer, die ich auch bei der verwendung von fstream bekommen hab <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f61e.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--disappointed_face"
      title=":("
      alt="😞"
    /></p>
</blockquote>
<p>Ist auch relativ logisch. 'wchar_t' definiert einfach nur Zeichen, die groß genug sein sollen, um Uncode-Codepunkte speichern zu können. Über die Codierung ist da aber noch nichts gesagt. In welchem Format ist denn die Datei gespeichert? Am einfachsten wird es wohl sein, die Datei in ein Byte-Array einzulesen (=&gt; char[]), und dann anhand der korrekten Codierung zu konvertieren.</p>
<p>Wie das mit der Konvertierung geht, ist hier beschrieben: <a href="http://www.kharchi.de/cpp_strings.html" rel="nofollow">http://www.kharchi.de/cpp_strings.html</a></p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339391</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339391</guid><dc:creator><![CDATA[Konrad Rudolph]]></dc:creator><pubDate>Mon, 06 Aug 2007 08:48:09 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 09:45:51 GMT]]></title><description><![CDATA[<p>Konrad! Ja, interessante Seite! <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f609.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--winking_face"
      title=";)"
      alt="😉"
    /> <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f603.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--grinning_face_with_big_eyes"
      title=":D"
      alt="😃"
    /> Leider fehlt da aber noch etwas (werde ich mal nachtragen müssen):<br />
<a href="http://www.boost.org/libs/serialization/doc/codecvt.html" rel="nofollow">http://www.boost.org/libs/serialization/doc/codecvt.html</a></p>
<p>Leider weiß ich nicht, ob es auch unter Windows bzw. MSVC funktioniert. <img
      src="https://www.c-plusplus.net/forum/plugins/nodebb-plugin-emoji/emoji/emoji-one/1f61e.png?v=ab1pehoraso"
      class="not-responsive emoji emoji-emoji-one emoji--disappointed_face"
      title=":("
      alt="😞"
    /></p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339425</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339425</guid><dc:creator><![CDATA[Artchi]]></dc:creator><pubDate>Mon, 06 Aug 2007 09:45:51 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 10:24:33 GMT]]></title><description><![CDATA[<p>wfstream ist nicht dafür da um unicode einzulesen, sondern um den betriebssystem spezifischen zeichensatz zu nutzen, und der ist zb unter windows nicht unicode sondern ein eigenes format.</p>
<p>wenn du unicode einlesen willst, musste wohl oder übel was eigenes schreiben oder das internet nach irgendwas passendem durchsuchen.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339438</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339438</guid><dc:creator><![CDATA[otze]]></dc:creator><pubDate>Mon, 06 Aug 2007 10:24:33 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 10:32:10 GMT]]></title><description><![CDATA[<p>otze schrieb:</p>
<blockquote>
<p>wfstream ist nicht dafür da um unicode einzulesen, sondern um den betriebssystem spezifischen zeichensatz zu nutzen, und der ist zb unter windows nicht unicode sondern ein eigenes format.</p>
</blockquote>
<p>Hm? Also aktuelle Windows-Versionen verwenden intern die BMP von UTF-16 (little endian), welche sich auch als UCS-2 auffassen lässts. Von &quot;eigenes Format&quot; kann hier keine Rede sein.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339443</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339443</guid><dc:creator><![CDATA[Konrad Rudolph]]></dc:creator><pubDate>Mon, 06 Aug 2007 10:32:10 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 11:22:37 GMT]]></title><description><![CDATA[<p>Der Inhalt und die Codierung einer Datei hat letztendlich auch nichts mit Windows zu tun. Sind am Ende alles eh nur Bits und Bytes die da auf der Platte (auch bei NTFS) abgelegt werden. Und eine Textdatei muß man genauso decodieren, wie man es auch mit z.B. Bild- oder Sounddateien machen muß.</p>
<p>wfstream ist schon richtig, auch unter Windows.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339474</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339474</guid><dc:creator><![CDATA[Artchi]]></dc:creator><pubDate>Mon, 06 Aug 2007 11:22:37 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 12:17:28 GMT]]></title><description><![CDATA[<p>kennt jemand ne 'deutschsprachige' seite wo der unterschied zwischen UTF UCS usw erklaert wird ?</p>
<p>btw: was hat ein 4 byte character fuer nen vorteil gegenueber einem 16 bit breien ? davon mal abgesehen das noch mehr speicherplatz verschwendet wird</p>
<p>Meep Meep</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339517</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339517</guid><dc:creator><![CDATA[Meep Meep]]></dc:creator><pubDate>Mon, 06 Aug 2007 12:17:28 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 12:22:54 GMT]]></title><description><![CDATA[<p><a href="http://de.wikipedia.org/wiki/Universal_Character_Set" rel="nofollow">http://de.wikipedia.org/wiki/Universal_Character_Set</a><br />
Von da aus wirst du erfahren was UTF ist und wo der Vorteil von 32bit breiten Charactern ggü. 16bit breiten ist.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339528</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339528</guid><dc:creator><![CDATA[Artchi]]></dc:creator><pubDate>Mon, 06 Aug 2007 12:22:54 GMT</pubDate></item><item><title><![CDATA[Reply to unicode datei einlesen? on Mon, 06 Aug 2007 12:25:20 GMT]]></title><description><![CDATA[<p>Meep Meep schrieb:</p>
<blockquote>
<p>kennt jemand ne 'deutschsprachige' seite wo der unterschied zwischen UTF UCS usw erklaert wird ?</p>
</blockquote>
<p>Den Unterschied kann man auch in einen Satz packen: UCS-2 bzw. -4 sind vom ISO-Konsortium entwickelte Standards, welche der Byte-Repräsentation von UTF-16 bzw. UTF-32 (jeweils als little endian) entsprechen, jedoch hat UCS-2 im Gegensatz zu UTF-16 eine feste Breite von zwei Oktet und repräsentiert damit nur die Basic Multilingual Plane.</p>
]]></description><link>https://www.c-plusplus.net/forum/post/1339531</link><guid isPermaLink="true">https://www.c-plusplus.net/forum/post/1339531</guid><dc:creator><![CDATA[Konrad Rudolph]]></dc:creator><pubDate>Mon, 06 Aug 2007 12:25:20 GMT</pubDate></item></channel></rss>