文字コード総合スレ part14

**デフォルトの名無しさん** · 2023/03/03(金) 15:46:58.08

Windows NTは初代からUnicodeがネイティブの文字コードです。cp932ではありません。
プログラマーなら一度は煩わされたことのある文字コードについてのスレ。
UTF-8、Shift_JIS、JIS、EUC、Unicode、UCS、サロゲートペア、コードポイント、文字コード判定、
合成文字、ソート、TRON、外字コード、その他について語り合いましょう。
各言語での文字列の扱いについての質問もOKです。
基本マッターリ、ささ、茶でもどうぞ。

■過去スレ
文字コード総合スレ part1 http://pc11.2ch.net/test/read.cgi/tech/1031028205/
文字コード総合スレ part2 http://pc11.2ch.net/test/read.cgi/tech/1143375639/
文字コード総合スレ part3 http://pc11.2ch.net/test/read.cgi/tech/1180250376/
文字コード総合スレ part4 http://pc11.2ch.net/test/read.cgi/tech/1228052369/
　（スレ再利用）UnicodeとUTF-8の違いは？ http://pc12.2ch.net/test/read.cgi/tech/1177930957/
　（隔離スレ）UnicodeとUTF-8の違いは？　その2 http://pc12.2ch.net/test/read.cgi/tech/1274937437/
文字コード総合スレ part5 http://pc12.2ch.net/test/read.cgi/tech/1236529563/
文字コード総合スレ part6 http://hibari.2ch.net/test/read.cgi/tech/1278923059/
文字コード総合スレ part7 http://toro.2ch.net/test/read.cgi/tech/1306595564/
文字コード総合スレ part8 http://peace.2ch.net/test/read.cgi/tech/1354248962/
文字コード総合スレ part9 http://peace.2ch.net/test/read.cgi/tech/1401301779/
文字コード総合スレ Part10 http://mevius.2ch.net/test/read.cgi/tech/1444822140/
文字コード総合スレ Part11 https://mevius.5ch.net/test/read.cgi/tech/1516629503/
文字コード総合スレ Part12 https://mevius.5ch.net/test/read.cgi/tech/1544931495/
文字コード総合スレ part13
https://mevius.5ch.net/test/read.cgi/tech/1593777227/

**デフォルトの名無しさん** · 2023/03/03(金) 18:50:36.86

乙

**デフォルトの名無しさん** · 2023/03/04(土) 05:49:15.61

Q. UTF-8 に BOM をつけるべきですか？
A. Unocode Standard では「付けたければ付けても良いが、付ける必要はないし、付けるのはお勧めしない」と規定されています。

**デフォルトの名無しさん** · 2023/03/04(土) 11:03:14.60

>>1
>Windows NTは初代からUnicodeがネイティブの文字コードです。cp932ではありません。

filesystem の文字コードと system locale についても詳しく
あとファイル名に BOM 必要かどうかも

**デフォルトの名無しさん** · 2023/03/04(土) 11:35:06.58

>>3
訳し方でニュアンスが変わるから根拠となる規格の原文も載せた方が良いぞ

**デフォルトの名無しさん** · 2023/03/04(土) 20:52:22.05

UTF-8, UTF-16, UTF-32 & BOM
https://unicode.org/faq/utf_bom.html

「付けたければ付けても良いが、付ける必要はないし、付けるのはお勧めしない」なんてどこにも書いてないんだが

**デフォルトの名無しさん** · 2023/03/04(土) 23:54:57.70

>>4
Windowsの場合はUnicodeというのはUTF-16LEを示す模様
UTF-16LEはリトルエンディアン固定でBOMは付かないフォーマット

UnicodeといってもUTF-8ではない

**デフォルトの名無しさん** · 2023/03/05(日) 00:42:43.70

>>3
何で規定されてんの？

**デフォルトの名無しさん** · 2023/03/05(日) 01:11:17.97

>>6
Unicode Standard を嫁。

**デフォルトの名無しさん** · 2023/03/05(日) 01:17:14.07

>>8
規格に理由は書かれてない。
規格書では趣旨として UTF-8 では Unicode をASCII互換にするための方式みたいな説明してるので、BOM をつけると ASCII互換性が崩れるのが駄目なのかもしれない。違うかもしれない。

**デフォルトの名無しさん** · 2023/03/05(日) 10:21:41.04

すまそ。ここの40ページにUTF-8でBOMが許可されるって書いてあった
https://www.unicode.org/versions/Unicode15.0.0/UnicodeStandard-15.0.pdf

Table 2-4. The Seven Unicode Encoding Schemes
Encoding Scheme: UTF-8
Endian Order: N/A
BOM Allowed?: yes

**デフォルトの名無しさん** · 2023/03/05(日) 10:24:42.19

The Unicode® Standard Version 15.0 – Core Specification
https://www.unicode.org/versions/Unicode15.0.0/ch03.pdf

When converting between different encoding schemes, extreme care must be taken in handling any initial byte order marks.
For example, if one converted a UTF-16 byte serialization with an initial byte order mark to a UTF-8 byte serialization, thereby converting the byte order mark to <EF BB BF> in the UTF-8 form, the <EF BB BF> would now be ambiguous as to its status as a byte order mark (from its source) or as an initial zero width no break space.
If the UTF-8 byte serialization were then converted to UTF-16BE and the initial <EF BB BF> were converted to <FE FF>, the interpretation of the U+FEFF character would have been modified by the conversion.
This would be nonconformant behavior according to conformance clause C7, because the change between byte serializations would have resulted in modification of the interpretation of the text.
This is one reason why the use of the initial byte sequence <EF BB BF> as a signature on UTF-8 byte sequences is not recommended by the Unicode Standard.

**デフォルトの名無しさん** · 2023/03/05(日) 10:24:58.61

>>10
ASCIIは文字コードで言えば0～127までの文字
UTF-8が使う128～255はASCII互換ではない

128～255を許容するのであれば
BOMもこの範囲に含まれるのでASCII互換

**デフォルトの名無しさん** · 2023/03/05(日) 11:15:20.72

一般に言うASCII互換ってそういう意味じゃねえだろ。

**デフォルトの名無しさん** · 2023/03/05(日) 12:40:57.35

BOMがもし先頭以外に現れたら読み飛ばす？

**デフォルトの名無しさん** · 2023/03/05(日) 16:31:35.44

>>13
ここで言われるASCII互換は、ASCII上位互換だな。
今までと同じ入力(ASCII)には同じ出力になることが期待されている。今まで勝手にBOMを付けなかったので、勝手にBOMつけるのはNGくらいの意味。

**デフォルトの名無しさん** · 2023/03/05(日) 17:06:23.64

>>12
「UTF-8 の先頭にある U+FEFF は BOM なのか ZWNBS なのか曖昧なのが、UTF-8 に signature として <FE BB BF> をつけることを推奨しない理由の一つ。」
と書いてあるのか。一つということは他にもあるのか。

**デフォルトの名無しさん** · 2023/03/05(日) 17:10:12.27

>>15
「BOM が不要の場合は先頭の U+FEFF は後方互換性のために ZWNBS として扱う」と規定には書かれいる。

**デフォルトの名無しさん** · 2023/03/05(日) 17:13:23.86

>>18
途中で送ってしまった。
当然途中にある U+FEFF は全て Zero Width Non-Breakable Space (ここで改行禁止くらいの意味）として扱われる。

**デフォルトの名無しさん** · 2023/03/05(日) 21:42:23.56

>>16
ASCIIと同じ出力になるって言うなら
0～127までの文字しか使えないじゃんｗ

まさか最初さえ同じなら、後ろは違ってもいいとかいう
意味不明な話してるの？

**デフォルトの名無しさん** · 2023/03/05(日) 21:44:41.60

>>20
素人発見。

**デフォルトの名無しさん** · 2023/03/05(日) 21:46:48.07

規格がどうであれ、可能な限りBOMをつけるのが最善策。

**デフォルトの名無しさん** · 2023/03/05(日) 21:53:29.71

>>22
とうとう規格無視しろって言い始めた。
オレオレ基準は他所でやれ。技術者どうしの合意は規格を使う。お前に発言する資格はない。

**デフォルトの名無しさん** · 2023/03/05(日) 21:56:43.19

元がASCII → UTF-8 （BOM なし）に変換？ → それはただのASCII

UTF-8に対応するのであれば
128～255を許容した上で
UTF-8の仕様に対応しなければいけない

UTF-8に対応するならBOMにも対応しなければいけない
それだけのこと

**デフォルトの名無しさん** · 2023/03/05(日) 21:59:56.36

UTF-8という規格に対応するのなら
BOMにも対応しろって話だな

**デフォルトの名無しさん** · 2023/03/05(日) 22:09:24.16

>>23
これは規格外をどうするかという話なので、規格の話をしても意味がないぞ
君はエンジニアにむいてない。技術者じゃなくて法律家にでもなれ。

**デフォルトの名無しさん** · 2023/03/05(日) 22:11:31.00

交通事故が起きた時に、人命救助したり、クルマを安全な場所に移動させようとするのが技術者。
交通事故の責任問題ばかり考えるのが法律家。ID:JF7lH/t4は技術者にむいてない。断言する。

**デフォルトの名無しさん** · 2023/03/05(日) 22:16:09.81

>>27
悔しかったら Unicode Standard 書き換えてこいや。もしくは賛同者つのって新しい規格でも作ったら？

**デフォルトの名無しさん** · 2023/03/05(日) 22:16:39.06

規格が不完全でも現実として運用していかなければならないのに、規格を盾に対応を拒否するような技術者はクビだよ

**デフォルトの名無しさん** · 2023/03/05(日) 22:20:27.96

>>29
規格が不完全なら規格を正しく修正するのが技術者の仕事。
お前の主張が正しいなら規格はとっくに直されてる。変更されないのは今の規格が正しいということ。

**デフォルトの名無しさん** · 2023/03/05(日) 22:26:54.92

>>30
そのとおり。誰も問題と思ってないのだからBOM付きはどんどん増える