X



Internet Archive総合 (web.archive.org) #3
■ このスレッドは過去ログ倉庫に格納されています
0001名無しさん@お腹いっぱい。
垢版 |
2020/04/02(木) 02:08:09.83
なんだかんだでお世話になってるInternet Archiveについて語りましょう
Internet Archive
ttp://www.archive.org/index.php

インターネット・アーカイブ - Wikipedia
ttp://ja.wikipedia.org/wiki/InternetArchive
  ------------------


Q.Internet Explorerで日本語などの2byte言語のページのWeb Archiveキャッシュを見ようとしても
真っ白なページ&文字化けが起きる&極端に重いなどの症状が出てしまう

A.[表示]もしくは右クリック→[エンコード]→[日本語(自動選択)]やその言語の文字コードに則したものをクリック


Q.Web Archiveでダウンロードしたzipなどが開けない&CRCが違うと表示される

A.よくWeb Archiveは1byte欠けを起こすのでバイナリエディタなどで該当ファイルを開き、
16進数の最後の末尾に「00」を付加すると正常なファイルになることがあります。


前スレッド
Internet Archive総合 (web.archive.org) #2
http://mevius.5ch.net/test/read.cgi/esite/1475246713/
0285名無しさん@お腹いっぱい。
垢版 |
2020/07/27(月) 12:24:25.45
>>284
だったら最初から制限事項を表示しろって話
騙し討ちみたいなもんじゃん
別に不正アクセスしたわけじゃないし、dos攻撃みたいに明らかに悪意あるように見えるほど高速でもないんだし
0288名無しさん@お腹いっぱい。
垢版 |
2020/07/27(月) 16:54:48.41
どうしてもアーカイブできないサイトはページ丸ごとスクショしてそれをどっかにあげてアーカイブすればいいか
でも大きなスクショ劣化なしであげられるとこってなかなかないよね
どっかあるかな?
0295名無しさん@お腹いっぱい。
垢版 |
2020/07/28(火) 06:39:39.83
https://gigazine.net/news/20191212-thread-internet-archives-silent-killer/
コストを削減したければクローリングするウェブサイトを減らし、一部のデータ保存活動を停止すればOKですが、この考えは世界全体にとっていいアイデアではないとスコット氏は主張。

1分20ページから50ページ保存に緩和してくれ

或いは有料プランを作ってくれ
0296◆P0jSlC5fJs
垢版 |
2020/07/28(火) 07:07:27.82
>>288
大抵はWayback Machineかarchive.todayかWebrecorderかSingleFileZで保存できる

おーぷん2chは基本拒まれるけどdatはアーカイブできる
例: http://archive.vn/nxwaU
通常のページを保存できるにしろできないにしろ、APIも保存してくれると助かる

例えばニコ生のAPIは
https://api.cas.nicovideo.jp/v1/services/live/programs/(番組ID)
番組IDのところをlv123とするとその番組の詳細情報が得られる
0297名無しさん@お腹いっぱい。
垢版 |
2020/07/29(水) 02:58:32.75
Internet Archive以外はいつサービス終了するか分からない
ローカルやログインして自分しか見れない所にアーカイブしても意味ない
0298名無しさん@お腹いっぱい。
垢版 |
2020/07/29(水) 03:33:40.66
Internet Archiveも見れないURLあるからなあ
0300名無しさん@お腹いっぱい。
垢版 |
2020/07/29(水) 13:06:06.70
> archive.todayは数十とか一気に取るとbanされるし、碌なアーカイブサイトないわ
いっぺんにそんな数ひろったことないな
やるねえ
0308名無しさん@お腹いっぱい。
垢版 |
2020/07/29(水) 23:12:14.28
>>307
> つなぎなおすと

繋ぎ直しで IP が変わったことが効いてるのか、ただ少し時間を空ければ良いだけなのか、
どっちなんだw
0310◆P0jSlC5fJs
垢版 |
2020/07/30(木) 01:13:52.97
>>297
archive.todayってやばいの?
>>280 を読む限りちゃんとリソースに見合った制限をかけてるようだし
削除に応じないからいつか陥落しそうってこと?

2行目は???
アーカイブしてもそれを共有せずアクセス不能な場所にのみ保管していても仕方ないってこと?
自分以外からも見れるようにすりゃいいじゃん
0311名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 04:36:43.89
確かに保存されたページが閲覧できているのに、APIの方では保存されていないかのような
表示になっていることもあるんだな。単にAPIの調子が悪いのか
0313名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 07:40:56.06
あー、すまん。

これは自分がページを指定して魚拓とることはできないのか。
0314名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 10:12:47.18
Sorry.
This URL has been excluded from the Wayback Machine.
この文が出るサイトはどんな方法でも保存はおろか閲覧すらできないんでしょうか
0315名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 10:17:20.01
>>310
archive todayってどこの会社が運営してるのか資金はどうしてるのかも分からないし比較的最近できた歴史もサイト
36年の歴史があって米国政府も利用してて組織内部まで公開してるInternet archiveとは信頼度が違う
WebrecorderやSingleFileZは共有機能あるの?見た感じ個人向けのキャプチャソフトみたいだけど
0321名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 21:03:12.09
>>318
マジ?
0322名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 22:23:53.68
>>310
アーカイブって「データが改変されていないこと」が保証されてなきゃいけないんだよ
だから単に「自分以外からも見えるようにすればいいじゃん」って問題ではない
0323名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 22:27:38.32
archive.todayは誰がどこでどういう風に運営してるのかまるで分からない(=いつデータが全て消し飛ぶか分からない)という怖さがある
だから自分はarchive.todayを可能な限り使わないようにしてるし、運営体制が公開されてるInternet Archiveを信用してる
0324名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 22:33:49.07
「データが改変されていないこと」を保証するのって結構厄介で、
Internet ArchiveはWARC形式っていうWebアーカイブ専用フォーマットを使って保存してるくらい
archive.todayやウェブ魚拓はその辺が全く公開されてない
スクショなんて論外だよ(ブラウザの開発者機能で画面表示を書き換えた上でスクショされたらどうしようもないから)
0325名無しさん@お腹いっぱい。
垢版 |
2020/07/30(木) 23:11:23.68
用途にもよる
単に面白いサイトだから残したい程度ならどこでもいい訳だし
何かの証拠として残すんなら信頼高いアーカイブの方がいいしな
0327322-324
垢版 |
2020/07/31(金) 00:23:14.62
証拠だろうと面白いサイトだろうと消えてほしくないからアーカイブする訳だから、
自分は信頼性の高さを重視して何でも基本的にInternet Archiveのみを使っている
archive.todayではIAで保存できなかったものと、特に証拠として残したいものを保存してる(削除申請が通りにくいため)
ウェブ魚拓は「申請が来たらすぐ消している」という運営のインタビューを見てから一切使わなくなった
0332名無しさん@お腹いっぱい。
垢版 |
2020/07/31(金) 07:54:38.33
全ページ検索ってまだできない?
そんなに機密情報とか簡単に検索されたくない?
0334名無しさん@お腹いっぱい。
垢版 |
2020/07/31(金) 10:08:22.40
自分の主張は正当化されるべきと信じ込んでる・とりあえず何でも陰謀論に結び付けるとか数え役満だな...
Internet Archiveにそんなサービスやってる余裕ないんだよ、一時期やってたけど処理が追いつかなくてすぐ廃止になったって前にも誰かが言ってただろ
0335名無しさん@お腹いっぱい。
垢版 |
2020/07/31(金) 19:43:31.80
そもそも最近のInternet Archiveは一枚もキャプチャ出来ない日がずっと続いてる
BANか時間帯か何が原因か知らんけど、VPNで時間帯変えても無理
0337名無しさん@お腹いっぱい。
垢版 |
2020/07/31(金) 19:58:20.86
>>336
そなの?取れてないと思って同じページ数回取り直しちゃったわw
urlで検索すると取れてる扱いなのに、開くと取得ページに一枚もないって出てるし
0345名無しさん@お腹いっぱい。
垢版 |
2020/08/01(土) 02:33:21.99
1年間以上定期的にツイッターで保存していたせいかtodayはBANされてるなぁ
どうやっても404になるわ
使える串探すか
0346名無しさん@お腹いっぱい。
垢版 |
2020/08/01(土) 15:49:18.93
自分はsave page nowのフォームから保存すると毎回問題なくいけてる(少なくともここ一週間くらいは)
spnフォーム保存時の通信を覗いて、処理をスクリプトに落とし込むというのも不可能ではないのでは
0348名無しさん@お腹いっぱい。
垢版 |
2020/08/01(土) 23:59:08.53
いろいろやってみたけど、俺の結論

7月後半ぐらいから/save/の後ろのURLつけて保存しようとすると、そのページにある画像とかも一部保存もしくはURLを確認しに行く(保存はされない)ように設計が変わったようで、
そのせいでページに張り付いてる画像やスクリプトファイルが多いブログを保存する時は特に時間かかりまくってる
スクリプトで保存してる場合、ヘッダーにno-cacheやetagが出てきたら、それは保存失敗
ブログやニュースサイトの画像URLやスクリプトURLの過去の履歴を見ると、
1日以下の短期間で何十回も何百回も保存してるのを7月以降たくさん見かけるのはこのせいだと思う
Internet Archive側のアーカイブシステムの改悪だ、保存が遅くなる一方だよこれ
0350名無しさん@お腹いっぱい。
垢版 |
2020/08/02(日) 08:37:26.17
本来ならInternet archiveをメインに使いたいところだが、いかんせん取れないままではなぁ
サイトに繋がるだけじゃ意味がない
337や339のレスと同じ結果ばかりで、もう一週間くらい取れてないから渋々archive.todayメインに切り替えてる
0355名無しさん@お腹いっぱい。
垢版 |
2020/08/02(日) 20:41:54.12
>>351
1年前はcurlで1分間400回ぐらいはエラーなしで保存できたんだよな
今は10回やって2〜5分休むを繰り返すしかできない
もちろん串刺すかIPアドレス変えれば無限にできるけど、遅すぎる
0356名無しさん@お腹いっぱい。
垢版 |
2020/08/02(日) 23:24:33.52
>>355
1分間400回とかそれは多すぎるよ、逮捕者が出た岡崎図書館事件ですら1回のアクセス毎に2秒の間隔を置いてたくらいなのに
みんながそんなことやりすぎたからアクセス回数の制限入ったんじゃないの?
万が一訴えられた時のことも考えて、どんなサイトでも1回のリクエスト送ってから最低1秒空けるのが不文律
0357名無しさん@お腹いっぱい。
垢版 |
2020/08/02(日) 23:27:33.15
どうしても早く保存したいなら自分で保存対象サイトにwgetを走らせて、
そこからInternet Archiveのmetadataとしてアップロードすりゃいい
Wayback Machineには収録されないが、早くやりたいんならそれくらい我慢しなきゃ仕方ないだろ
0363名無しさん@お腹いっぱい。
垢版 |
2020/08/03(月) 10:45:09.75
>>356
その辺の画像多用のブログをsave nowで保存するだけで画像やスクリプトで200のURLを一気に保存するんだが
考えてみればsave nowの方がサーバーに優しくないんだよ
0368名無しさん@お腹いっぱい。
垢版 |
2020/08/03(月) 16:32:26.47
保存するのは芸能人のブログとかじゃないの

芸能人の画像をPCに保存にしないでIAを、クラウド代わりにする。
0372名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 08:28:31.29
The capture is estimated to start in 600 minutes.
昨日ぐらいからSave Page Nowでこんな表示出てくるんだけど、あと10時間も待ってないといけないわけ?
いい加減にサーバー増強しろよ。。
0373名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 10:01:44.45
Tweetsaveについて知らないニワカが落ちてると叩くのは
サービスを潰しかねない迷惑行為なのでやめてもらいたい
0376名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 11:57:24.72
Internet Archiveも資金繰りが厳しいらしいからな
サーバの重さに文句言っていいのは寄付した人間だけだろ、自分は寄付してないから当然言えない
0379名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 17:50:56.70
なんでこんなんなっちゃったんだ
0380名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 18:13:31.23
国外のニュースサイトとかじゃあまり話題にしないな
0382名無しさん@お腹いっぱい。
垢版 |
2020/08/04(火) 20:45:36.63
ここに書いてもしょうがないかしらんが
サイト撤去跡などでリダイレクトされるやつのリダイレクトが早すぎて
結局アドレスバーに直打ちしないと目当てのサイトを探せないのは何かなあ
■ このスレッドは過去ログ倉庫に格納されています

ニューススポーツなんでも実況