Internet Archive総合 (web.archive.org) #3
レス数が1000を超えています。これ以上書き込みはできません。
0001名無しさん@お腹いっぱい。
垢版 |
2020/04/02(木) 02:08:09.83
なんだかんだでお世話になってるInternet Archiveについて語りましょう
Internet Archive
ttp://www.archive.org/index.php

インターネット・アーカイブ - Wikipedia
ttp://ja.wikipedia.org/wiki/InternetArchive
  ------------------


Q.Internet Explorerで日本語などの2byte言語のページのWeb Archiveキャッシュを見ようとしても
真っ白なページ&文字化けが起きる&極端に重いなどの症状が出てしまう

A.[表示]もしくは右クリック→[エンコード]→[日本語(自動選択)]やその言語の文字コードに則したものをクリック


Q.Web Archiveでダウンロードしたzipなどが開けない&CRCが違うと表示される

A.よくWeb Archiveは1byte欠けを起こすのでバイナリエディタなどで該当ファイルを開き、
16進数の最後の末尾に「00」を付加すると正常なファイルになることがあります。


前スレッド
Internet Archive総合 (web.archive.org) #2
http://mevius.5ch.net/test/read.cgi/esite/1475246713/
0906名無しさん@お腹いっぱい。
垢版 |
2021/06/01(火) 03:49:59.92
swfのあるページの取得厳しいんだっけ
Cannot fetch the target URL due to system overload.がでる

todayのほうで試したらプロセスが空白で進行せず
megarodonは見かけ上はとれてるがソースからswfの現物アドレスを消して保存してるっぽい

ファイル固有の問題だろうか
デバッガでは開けるんだが
0910名無しさん@お腹いっぱい。
垢版 |
2021/06/01(火) 13:20:35.24
激遅の/save/で行けたりしない?>swf
保存できても表示が更新されないので本当に保存されているか未確認だけど
0915名無しさん@お腹いっぱい。
垢版 |
2021/06/02(水) 04:57:26.97
>>910
個別のswfのアドレス投げ込んだら保存できたからひとまずはいいことにする
開くときは開けるアドレスを知ってないとあかんね
デバッガだと「swfを置いてるページ」では開けないんでarchiveのソースに書かれてる現物のアドレスを掘り出してデバッガに渡すまでしないと開かない
(開けるのは確認できた)

>>911
なんかアナウンスされてたよね archiveのswf全部を勝手にブラウザ上で再生してくれるようなものを期待しちゃうけど
そこまでするのは結構大変なはず
0916名無しさん@お腹いっぱい。
垢版 |
2021/06/02(水) 08:47:16.75
3Gガラケーの本体自体にフラッシュの再生機能付いててアーカイブ含め見れるが画面が小さいのがあかんな
ガラケー向けの時計フラッシュまちうけフラッシュは本体が壊れない限り確実に永遠に見れるけどペリーのピアノ講師ネタとか永遠に失われそう
0917名無しさん@お腹いっぱい。
垢版 |
2021/06/02(水) 14:33:51.58
SPNを保存されたかの確認に使うというわけ分からん状況になってる。
誰かが過去に保存したであろう複数ページの記事が途中歯抜けで保存されているのを見かけた。保存失敗か?
元の記事はもう見れないから補完してあげることもできなかった。
0918名無しさん@お腹いっぱい。
垢版 |
2021/06/02(水) 14:54:32.98
twitterの保存だけやけに時間かかるんだけど
0919名無しさん@お腹いっぱい。
垢版 |
2021/06/09(水) 00:42:55.87
「Ruffle」というchrome拡張機能使えばFlash見れるよ
0920名無しさん@お腹いっぱい。
垢版 |
2021/06/09(水) 01:11:29.08
Sorry
You have already reached the limit of active sessions

先週からエラー出まくり
0921名無しさん@お腹いっぱい。
垢版 |
2021/06/09(水) 06:03:50.69
>>920
おまいさんのやり方が悪いだけ。先月の制限強化に引っ掛かってるんだろ。
https://docs.google.com/document/d/19RJsRncGUw2qHqGGg9lqYZYf7KKXMDL1Mro5o1Qw6QI/edit
> 2021-05-23
> Anonymous users have lower concurrent captures limit (limit=3) compared to authenticated users (limit=5).

制限値を超えないよう、保存開始のタイミングを調整するしか無い。
アカウントを作ってログインすれば従前の制限値に戻る上、空きセッション数を API で
得られるようになるので、自動的に空きを待ってから保存するようなシステムも
組めるようになる。
https://web.archive.org/save/status/user (ログインしていなければ 503 エラー)

Change Log に記載は無いが、ログイン済みユーザの制限値は 6 に緩和されている模様。
("available":6)
0923名無しさん@お腹いっぱい。
垢版 |
2021/06/09(水) 16:25:44.73
ブラウザが (IA のヘッドレスブラウザも含めて) リファラを送らなくなったとか
そういう話じゃ無くて?
0925名無しさん@お腹いっぱい。
垢版 |
2021/06/09(水) 18:29:55.92
制限するぐらいなら、有料化しろよ
0928名無しさん@お腹いっぱい。
垢版 |
2021/06/10(木) 09:46:43.59
そうそう、IA のアーカイブはサーバのレスポンスヘッダが丸ごと保存されていることに留意。
つまり Set-Cookie でクッキーが返されていた場合、それも保存されているという事。
ログイン管理にクッキーを利用しているサイトで、アーカイブのデータを利用して
誰かに勝手にログインされるという事も起こりうる。
0933名無しさん@お腹いっぱい。
垢版 |
2021/06/12(土) 23:14:58.67
最近、頻繁に使うようになったけど、今繋がらないみたいだね。
だいたいどれくらいで復帰するんだろうか?
1日2日はかかるかな?
0940名無しさん@お腹いっぱい。
垢版 |
2021/06/15(火) 09:25:17.87
>>939
Due to a planned power outage, our services will be reduced on Tuesday, June 15th, starting at 8:30am PDT until the work is complete. We apologize for the inconvenience.

この程度の英文すら機械翻訳使わなきゃ読めない低能
0943イモー虫
垢版 |
2021/06/18(金) 20:45:23.13
読み込み機能は機能しているのか
0944名無しさん@お腹いっぱい。
垢版 |
2021/06/19(土) 14:06:16.43
The capture is estimated to start in 120 minutes. You may close your browser window and the page will still be saved.

うっかりログインし忘れるとこれだわw
0949名無しさん@お腹いっぱい。
垢版 |
2021/06/20(日) 00:40:25.87
1085分、てかアカウントでログインして保存しようとしてもこの表示出るじゃん
アカウント作った意味ないわ
0950名無しさん@お腹いっぱい。
垢版 |
2021/06/20(日) 01:26:26.34
待ち時間が一度表示されてしまうと、その後ログインして
同じURLの再保存を試みても待ち時間が延びるだけ。
0952名無しさん@お腹いっぱい。
垢版 |
2021/06/20(日) 12:42:15.80
保存は匿名で出来るんですか?
0955名無しさん@お腹いっぱい。
垢版 |
2021/06/21(月) 02:12:27.28
伊是名夏子のブログのアーカイブを見ようとすると
6月初めぐらいからThis URL has been excluded〜が出るようになってるんだけど、
非表示化か削除依頼出したみたいだねこれ。
0956名無しさん@お腹いっぱい。
垢版 |
2021/06/21(月) 10:45:02.62
アーカイブのアーカイブが必要になりそう
0962名無しさん@お腹いっぱい。
垢版 |
2021/06/27(日) 13:37:52.83
>>952
>>57

問題なのは関連付けされてる場合はログインしている時のメールアドレスやユーザ名、ログイン関係なくハッシュ化したIPアドレスやUserAgent部分がWARCファイルの名前フィールド部分に保存される可能性がある。
気になるなら保存するときだけUserAgentやIPアドレス変えたり保存するページごとに別ければいい。
0966名無しさん@お腹いっぱい。
垢版 |
2021/07/12(月) 07:09:59.53
あるWEBサイトの一部が消えているのだけれど、
インターネットアーカイブでも履歴が残っていないことがある
忍者とかいうブログサイトを使っているのだが、
あそこって削除した画像とかの履歴を残さないようにする機能とかあるのだろうか
0967名無しさん@お腹いっぱい。
垢版 |
2021/07/12(月) 16:06:59.65
>>966
他の魚拓サイトにも残ってないの?まあブログはアーカイブされてないことが多いからなぁ。
0968名無しさん@お腹いっぱい。
垢版 |
2021/07/12(月) 16:33:16.08
忍者って昔やたらボット除けに精を出してた所じゃないか
って今時の人は知らんのか

で、もうそろそろ次スレテンプレの話題でも
0970名無しさん@お腹いっぱい。
垢版 |
2021/07/14(水) 01:47:06.23
ツイッターのアーカイブ保存、回収の法則テンプレに入れようぜ。
アーカイブ保存は
mobile.ツイッター.com
でなければならないが
回収web.archive.org/web/9999/はmobile.を外さなきゃならない
ってこれガラケーだけ?
0972名無しさん@お腹いっぱい。
垢版 |
2021/07/16(金) 04:27:32.78
普通にTwitterをアーカイブすればmobileは付かないと思うんだが・・・
それは置いといて>>5とかの話は入れたほうが良さそう
0976名無しさん@お腹いっぱい。
垢版 |
2021/07/18(日) 19:27:16.87
ttps://wiki.archiveteam.org/images/e/e6/Archiveteam.jpg
archiveteamが保存した一部のスナップショットを見ると、この「俺たちが保存したぜ」画像のURLを読み込むから、
誰がどのページを見たかarchiveteamのウィキサイトに情報が漏れるんだけど、ただのスパイじゃねーか。
Internet Archiveの人は誰も気付いてないのかなこれ。
0978名無しさん@お腹いっぱい。
垢版 |
2021/07/19(月) 02:22:16.98
>>977
個人がアップロードしたWARCファイルは扱ってないじゃん
結局のところ制限引っかからないように/save/にURL投げるコードしか組めんよ
何も知らない無能はお前だ
0979名無しさん@お腹いっぱい。
垢版 |
2021/07/19(月) 05:43:32.79
そのレベルの情報を気にするなら個人でproxyなりVPNなり使えばいいのでは
なぜArchiveTeamだけを気にしてるのかは知らんが
0980名無しさん@お腹いっぱい。
垢版 |
2021/07/19(月) 22:59:58.68
>>976
ほんまや
About this captureの説明のところに埋め込んであった
でもブラウザの挙動はCSPで読み込みブロックってなってるから
インターネットアーカイブ側の対策でデータは送信されてない感じかね
0982名無しさん@お腹いっぱい。
垢版 |
2021/07/23(金) 16:15:09.58
インターネットアーカイブが25歳になったら、知識がすべての人にとってよりアクセスしやすくなった極めて重要な瞬間を経て、戻る方法から進む方法への旅にあなたを招待します。

アレクサンドリア図書館からヨハネスグーテンベルクによる印刷機の発明まで。
情報への権利の第一修正の保証からワールドワイドウェブの作成まで、知識へのアクセスは常に建設者と夢想家のおかげでした。

さて、ブリュースター・ケールという若いコンピューター科学者がデジタル時代の「すべての図書館」を建設することを夢見ていた1996年にさかのぼります。
人類の出版されたすべての作品を含み、一般に無料で、時代を超えて非営利団体として構成されたライブラリ。彼はこのデジタルライブラリをインターネットアーカイブと名付けました。
その使命は、すべての人に「すべての知識への普遍的なアクセス」を提供することです。

この25年のマイルストーンに関するブリュースターの考察を読む

バーチャルセレブレーションに参加する
あなたが世界のどこにいても、私たちと一緒に祝いに来てください。

ウェイバックからウェイフォワードへ:25のインターネットアーカイブ
星を目指して到達したビルダーと夢想家との仮想の旅。
10月21日木曜日午後6時PT(午後9時ET)
0983名無しさん@お腹いっぱい。
垢版 |
2021/07/24(土) 02:54:26.16
YoutubeのURL取ったら下のメッセージが出た
It may take a few days for YouTube videos to become available for playback.

動画もアーカイブされてるってことでいいのかな?
0984名無しさん@お腹いっぱい。
垢版 |
2021/07/24(土) 13:53:59.14
Youtubeを保存したいなら手動保存が望ましい。クローラーの保存だと再生できないケースあり。
0991名無しさん@お腹いっぱい。
垢版 |
2021/08/01(日) 18:27:20.02
それはしゃーない
0992名無しさん@お腹いっぱい。
垢版 |
2021/08/01(日) 19:07:49.48
次スレたのんます
0994名無しさん@お腹いっぱい。
垢版 |
2021/08/13(金) 07:19:48.01
Tor clients have already done 200,000 captures today. Please email us at "info@archive.org" if you would like to discuss this more.
とか出てきたんやけど・・・
0995名無しさん@お腹いっぱい。
垢版 |
2021/08/13(金) 09:36:18.65
Tor使ってないのに俺も今日初めてそのエラーが出てきた
9時過ぎたので、一応リセットされて表示されなくなったが、
毎日これが出たら困るな、特に朝保存したい場合は
0997名無しさん@お腹いっぱい。
垢版 |
2021/08/13(金) 19:21:46.35
>>993

おつでござんす
1000名無しさん@お腹いっぱい。
垢版 |
2021/08/13(金) 20:56:15.43
【 html化されたこのスレを読んでいるお前へ 】

おい、お前。そう、お前だよ。
「このスレおもろいから見てみ」「2ちゃんの歴史に残る名スレだぜ」とか言われてホイホイと
このhtml化されたスレを見にきた、お前のことだ。
どうだ?このスレおもしれーだろ。
でもな、お前はこのスレを読むだけで、参加することはできねーんだよ。
可愛そうにな、プププ。
俺は今、ライブでこのスレに参加してる。
すっげー貴重な経験したよ。この先いつまでも自慢できる。
まあ、お前みたいな出遅れ君は、html化されたこのスレを指くわえて眺めてろってこった。
レス数が1000を超えています。これ以上書き込みはできません。

ニューススポーツなんでも実況