オープンソースの全文検索エンジン全般を扱うスレッドです。
ソフトウェアによっては固有のスレッドが立てられている場合もあります。
それらについては適宜リンクを張ります。
Namazu http://www.namazu.org/
Glimpse http://webglimpse.org/
SWISH++ http://homepage.mac.com/pauljlucas/software/swish/
ht:/Dig http://www.htdig.org/
Comparing Open Source Indexers
http://www.infomotions.com/musings/opensource-indexers/
関連スレッド
全文検索ユーティリティ統一スレッド
http://pc.2ch.net/test/read.cgi/bsoft/1006680403/
ビジネスソフト板のスレッドです。
主に Windows のパッケージソフトについてのようです。
Microsoftの全文検索ソフト(Indexing Service等)
http://pc3.2ch.net/test/read.cgi/win/1035387243/
オープンソースの全文検索ソフト
■ このスレッドは過去ログ倉庫に格納されています
1はるお
02/11/01 03:28ID:5yfQC/Z+52動画直リン
03/05/18 21:12ID:pMLvChGr53login:Penguin
03/05/18 22:35ID:HWT5FF0a おい、聞いてくれ!
リナックス板の自治厨が、一切規定に反していない
ディストリスレを、通告もなく一方的に削除しやがった!
これは、そのディストリを発売した会社に対する
侮辱であり、1の言論の自由を侵害し
ユーザーに対する差別的行為だ!
まじで、どうにかしてくれ!
2ちゃんねるは、削除人が横暴すぎる!
革命を起こそう!正常化を図るのだ!
リナックス板の自治厨が、一切規定に反していない
ディストリスレを、通告もなく一方的に削除しやがった!
これは、そのディストリを発売した会社に対する
侮辱であり、1の言論の自由を侵害し
ユーザーに対する差別的行為だ!
まじで、どうにかしてくれ!
2ちゃんねるは、削除人が横暴すぎる!
革命を起こそう!正常化を図るのだ!
03/05/18 23:15ID:zVhF4GzV
55山崎渉
03/05/22 01:54ID:p4opmoqv ━―━―━―━―━―━―━―━―━[JR山崎駅(^^)]━―━―━―━―━―━―━―━―━―
56login:Penguin
03/05/25 14:46ID:9kb89l38 保存age
57山崎渉
03/05/28 16:51ID:3t6i6zxR ∧_∧
ピュ.ー ( ^^ ) <これからも僕を応援して下さいね(^^)。
=〔~∪ ̄ ̄〕
= ◎――◎ 山崎渉
ピュ.ー ( ^^ ) <これからも僕を応援して下さいね(^^)。
=〔~∪ ̄ ̄〕
= ◎――◎ 山崎渉
58山崎 渉
03/07/15 11:33ID:doz396Fq__∧_∧_
|( ^^ )| <寝るぽ(^^)
|\⌒⌒⌒\
\ |⌒⌒⌒~| 山崎渉
~ ̄ ̄ ̄ ̄
59ぼるじょあ ◆yBEncckFOU
03/08/02 05:28ID:GfRe8vK7 ∧_∧ ∧_∧
ピュ.ー ( ・3・) ( ^^ ) <これからも僕たちを応援して下さいね(^^)。
=〔~∪ ̄ ̄ ̄∪ ̄ ̄〕
= ◎――――――◎ 山崎渉&ぼるじょあ
ピュ.ー ( ・3・) ( ^^ ) <これからも僕たちを応援して下さいね(^^)。
=〔~∪ ̄ ̄ ̄∪ ̄ ̄〕
= ◎――――――◎ 山崎渉&ぼるじょあ
03/08/03 21:51ID:fPpEk/oO
( ・∀・) | | ガッ
と ) | |
Y /ノ 人
/ ) < >__Λ∩
_/し' //. V`Д´)/
(_フ彡 / ←>>57-59
と ) | |
Y /ノ 人
/ ) < >__Λ∩
_/し' //. V`Д´)/
(_フ彡 / ←>>57-59
61login:Penguin
03/08/03 21:55ID:fPpEk/oO http://slashdot.jp/journal.pl?op=display&uid=64&id=145402
mnoGoSearchがChaSen使えることは知っていたけど、MeCabにも
対応してたのか...
mnoGoSearchがChaSen使えることは知っていたけど、MeCabにも
対応してたのか...
62山崎 渉
03/08/15 23:03ID:dil3w4kp (⌒V⌒)
│ ^ ^ │<これからも僕を応援して下さいね(^^)。
⊂| |つ
(_)(_) 山崎パン
│ ^ ^ │<これからも僕を応援して下さいね(^^)。
⊂| |つ
(_)(_) 山崎パン
63
03/08/27 13:44ID:6MpoQSIc 保守
64保守
03/09/20 20:35ID:QpTH45NV >>15
8/28 に GETA の微修正があったらすぃ
8/28 に GETA の微修正があったらすぃ
65login:Penguin
03/09/20 22:25ID:Qruzqufd 外国産検索ソフトを日本語化してるようなプロジェクトって無いの?
03/09/20 22:27ID:y66iMG8F
67login:Penguin
03/09/25 16:55ID:FN6PNMc8 (・∀・)renice!
03/10/12 21:26ID:cR8wVZot
grep使え
69login:Penguin
03/10/20 12:05ID:KAqZYR1T Snatcher Full-text Search System
http://www.arc.ritsumei.ac.jp/kachina/mikio/snatcher-ja.html
これ使ってる人いる?
http://www.arc.ritsumei.ac.jp/kachina/mikio/snatcher-ja.html
これ使ってる人いる?
03/10/23 14:26ID:SeSnO0ZE
んで、何でこのスレがLinux板なの?
72login:Penguin
03/10/23 21:52ID:mpkZUnH903/10/24 00:10ID:vQ8fcb8K
ソフトウエア板を知らないのか?
03/10/24 00:50ID:06+8iSEx
ソフト板に立てたら、オープンソースという言葉だけで変なのが沸いてくるよ。
03/10/24 03:35ID:1jt/WYmb
なぜ Unix 板じゃないのか、と。
76login:Penguin
03/10/24 20:48ID:6ND9YDuW インデックス作るのが面倒なんでインデックス作らないソフトでのお勧めは何ですか?
03/10/24 21:03ID:FDJAXhV8
grep
03/10/24 21:15ID:qnB5L9GH
migemo
79login:Penguin
03/10/25 16:29ID:G0KBMFW/ QDBM日本語化期待あげ
80login:Penguin
03/12/04 19:59ID:nE27Bo0X Snatcherの掲示板より
> とりあえず、QDBMの全文検索機能を日本語化しただけのものを作ってみました。
> 以下の場所に置いてあります。
>
> http://estraier.sourceforge.net/
全然気がつかなかったけど、キテタ━━(゚∀゚)━( ゚∀)━( ゚)━( )━( )━(゚ )━(∀゚ )━(゚∀゚)━━!!!!!
> とりあえず、QDBMの全文検索機能を日本語化しただけのものを作ってみました。
> 以下の場所に置いてあります。
>
> http://estraier.sourceforge.net/
全然気がつかなかったけど、キテタ━━(゚∀゚)━( ゚∀)━( ゚)━( )━( )━(゚ )━(∀゚ )━(゚∀゚)━━!!!!!
81login:Penguin
03/12/17 15:15ID:jszsTTTz もつかれさん
82login:Penguin
03/12/24 03:38ID:OxnB4HEQ >80
人柱&報告よろ。
人柱&報告よろ。
83login:Penguin
04/01/03 20:35ID:8l191Pw0 うへ、QDBMもEstraierもリリース頻繁杉…
いや、まあいいことなのかもしれないけど、人柱になるのも大変だな。
いや、まあいいことなのかもしれないけど、人柱になるのも大変だな。
04/01/04 00:41ID:IhVjMv+b
とか言ってる間にもまた新しいバージョン出てるし。
ハングルの需要とかあんのか?
ハングルの需要とかあんのか?
04/01/04 14:26ID:cMFZ5pqM
> ハングルの需要とかあんのか?
少なくとも日常的にハングルの読み書きをしている人たちには
需要はあるんじゃない?
少なくとも日常的にハングルの読み書きをしている人たちには
需要はあるんじゃない?
04/01/04 18:08ID:YeVwrTI/
mhtに対応してほしいところだな。
87login:Penguin
04/01/15 15:51ID:4hNsgU5V >>86
もう対応したらしい。早っ!
もう対応したらしい。早っ!
88login:Penguin
04/02/14 11:46ID:ZilSN3qC Snatcher掲示板がなくなっとる。_| ̄|◯
89login:Penguin
04/02/15 01:33ID:0Iqfu11q Estraierに移行するからSnatcherの保守は停止するって掲示版に書いてあった。
それはいいとして、代わりにできたMLが英語だけっぽいのがどうにもこうにも。
それはいいとして、代わりにできたMLが英語だけっぽいのがどうにもこうにも。
04/02/15 08:15ID:z0/wDnUA
msearch使ってるひといる?
namazuより導入簡単だしカスタマイズも簡単だし。
namazuより導入簡単だしカスタマイズも簡単だし。
04/02/15 13:11ID:z+Cgu3BW
>1 は、「全文検索」と「Index検索」を間違えてないか?
namazuは全文検索じゃないぞ。
スレタイ見たときに、「grepの話か?」と思ったんだが。
namazuは全文検索じゃないぞ。
スレタイ見たときに、「grepの話か?」と思ったんだが。
92login:Penguin
04/02/15 13:15ID:NZlEcpUW うわあ……サムイやつが出現したな……
04/02/15 13:41ID:yQb5nWSx
>>91は日経Linuxのアレな記事を鵜呑みにしているアフォ。
平河町の書き換えも困ったものだ。
平河町の書き換えも困ったものだ。
94login:Penguin
04/02/15 14:49ID:QIqnUolY95login:Penguin
04/02/15 20:28ID:Ww9oGBM3 全文検査君ソフト
04/02/16 01:48ID:byAKcKCV
記事のことは知らんけど、
ファイル名や更新日などから特定のファイルを見つけ出すのと違って、
ファイルの内容からキーワードを拾ってファイルを探すのが全文検索。
全文検索にとってINDEX検索とは、検索の一手段ということになる。
って感じか。
ファイル名や更新日などから特定のファイルを見つけ出すのと違って、
ファイルの内容からキーワードを拾ってファイルを探すのが全文検索。
全文検索にとってINDEX検索とは、検索の一手段ということになる。
って感じか。
9794
04/02/16 08:33ID:jsLgsjIe >>96
その定義だと「全文」の言葉を使うのはおかしいんでねーの?
むしろ「ファイル検索」というのがふさわしいと思う
あくまでテキストすべて(全文)を検索するから「全文検索」じゃないの?
だったらやっぱりINDEX検索だけだと全文検索の要件を満たさないと思うなー
NamazuがINDEX検索だけなのかどうかは分かりませんが
その定義だと「全文」の言葉を使うのはおかしいんでねーの?
むしろ「ファイル検索」というのがふさわしいと思う
あくまでテキストすべて(全文)を検索するから「全文検索」じゃないの?
だったらやっぱりINDEX検索だけだと全文検索の要件を満たさないと思うなー
NamazuがINDEX検索だけなのかどうかは分かりませんが
04/02/16 09:17ID:/jHxVGIA
ナンセンスな方向に逝く悪寒...
04/02/16 09:24ID:R6980Jy2
インデックスを作るにあたって記事の全文を対象にしてるわけだから、全文検索と言えるでしょ。
やたら狭義に解釈してもしょうがない。
やたら狭義に解釈してもしょうがない。
10094
04/02/16 09:28ID:jsLgsjIe04/02/16 10:07ID:fwCweVDc
>>100よくわからんが grep なら全文検索なのか?namazuは中身を区切ってindex作って検索するから全文検索ではないと?
04/02/16 11:02ID:oD1epa/W
語の境界を無視するような検索がしたいときに悲しいとか、そういう話かな…
Namazu は二語のフレイズ検索には対応してて、三語以上は誤認識が入るってことみたいだけど。
Namazu は二語のフレイズ検索には対応してて、三語以上は誤認識が入るってことみたいだけど。
10394
04/02/16 11:10ID:jsLgsjIe >>101
とりあえずgrepは全文検索だよね。指定したファイルについては
全文をだーっとナメてるわけだから
だけどそれだと検索時間がかかるから、いわゆる全文検索ソフトは色々工夫をしてる
そのひとつがINDEX作成なわけですよね
で、私が思ったのは、その工夫によって「全文をナメる」のと違う結果(検索洩れとか)
が出るようなのは「全文検索ソフト」とは言えないんではないかってことです
先に挙げた「萌え語INDEX」は極端な例に見えるかもしれないけど
俺としては「自立語INDEX」(かどうかは知らんですが)も「全文をナメるのとは違う」
って意味では同じだと思う
>>102
フレイズ検索云々を意識しなければならない点で変な気がします
もちろん実用的には問題ないと思っていますし、Namazuは良いソフトとも思いますが
grepで検索するときって、フレイズ検索とか意識しませんよね?
とりあえずgrepは全文検索だよね。指定したファイルについては
全文をだーっとナメてるわけだから
だけどそれだと検索時間がかかるから、いわゆる全文検索ソフトは色々工夫をしてる
そのひとつがINDEX作成なわけですよね
で、私が思ったのは、その工夫によって「全文をナメる」のと違う結果(検索洩れとか)
が出るようなのは「全文検索ソフト」とは言えないんではないかってことです
先に挙げた「萌え語INDEX」は極端な例に見えるかもしれないけど
俺としては「自立語INDEX」(かどうかは知らんですが)も「全文をナメるのとは違う」
って意味では同じだと思う
>>102
フレイズ検索云々を意識しなければならない点で変な気がします
もちろん実用的には問題ないと思っていますし、Namazuは良いソフトとも思いますが
grepで検索するときって、フレイズ検索とか意識しませんよね?
04/02/16 11:16ID:fLalTCNO
>フレイズ検索云々を意識しなければならない点で変な気がします
日本語で分かち書き処理しないでどうやって処理するの?
日本語で分かち書き処理しないでどうやって処理するの?
10594
04/02/16 11:29ID:jsLgsjIe04/02/16 12:34ID:/jHxVGIA
それを検索に使うと効率が悪いように思えるんだが、どうよ?
ttp://www.ya.sakura.ne.jp/~moro/resources/ngram/
ttp://www.ya.sakura.ne.jp/~moro/resources/ngram/
04/02/16 12:46ID:+Ig7jOcp
N-gramって海外ではむしろ言語及び文字セットの判別の方で
よく使われているような気がする。mnoGoSearchのところの
mguesserとか。
よく使われているような気がする。mnoGoSearchのところの
mguesserとか。
10894
04/02/16 12:50ID:jsLgsjIe >>106
N-gramだとノイズが増えるのは確かだよ。だけどそのリンク先にあるように検索洩れが少ない利点がある
どっちを使うかは用途次第で一慨に効率が良いとか悪いとかは言えないと思う
だけど今問題にしてるのはそういうことではなくて
検索洩れが生じるような検索方式は全文検索ではない、というのは結構的を射ている指摘じゃないかってことです
もちろん全文検索でなくても有用ならそれで言い訳だし、そもそも全文検索の定義が曖昧なら
どっちでも良いってことだろうけどね
N-gramだとノイズが増えるのは確かだよ。だけどそのリンク先にあるように検索洩れが少ない利点がある
どっちを使うかは用途次第で一慨に効率が良いとか悪いとかは言えないと思う
だけど今問題にしてるのはそういうことではなくて
検索洩れが生じるような検索方式は全文検索ではない、というのは結構的を射ている指摘じゃないかってことです
もちろん全文検索でなくても有用ならそれで言い訳だし、そもそも全文検索の定義が曖昧なら
どっちでも良いってことだろうけどね
10994
04/02/16 12:51ID:jsLgsjIe 「言い訳」→「良い訳」です。スマソ
11094
04/02/16 12:55ID:jsLgsjIe111login:Penguin
04/02/16 15:10ID:zuK7uokm11294
04/02/16 15:57ID:jsLgsjIe >>111
うーん。それよりも「なぜ全パターン検索できないの」→「全文を対象にした検索じゃないからでしょ」
という感じでしょうか。つまり検索対象がfull textならば、全パターン検索できて当然
できない理由はINDEXから情報が欠落しているから、つまりfull text searchではない、という考え方です
結局は「全文検索」って何よ?という定義の問題になるわけですが…
うーん。それよりも「なぜ全パターン検索できないの」→「全文を対象にした検索じゃないからでしょ」
という感じでしょうか。つまり検索対象がfull textならば、全パターン検索できて当然
できない理由はINDEXから情報が欠落しているから、つまりfull text searchではない、という考え方です
結局は「全文検索」って何よ?という定義の問題になるわけですが…
113login:Penguin
04/02/16 20:37ID:IioubxCd そんなに全文検索がいいなら おれが書いてやるよ。
#! /bin/sh
grep $1 /
#! /bin/sh
grep $1 /
04/02/16 20:42ID:fRbfYEJy
04/02/16 20:52ID:feCC2G5u
文書の編者が意識的に選んだキーワードを頼りにして検索する「キーワード検索」との対比で、
対象文書のテキスト全体を操作して抽出した語やフレーズを頼りに検索する手法を総称して
「全文検索」と呼んでいるのだと思われ。
とすると、必ずしも再現率が100%である必要はないんじゃない?
対象文書のテキスト全体を操作して抽出した語やフレーズを頼りに検索する手法を総称して
「全文検索」と呼んでいるのだと思われ。
とすると、必ずしも再現率が100%である必要はないんじゃない?
116login:Penguin
04/02/16 22:06ID:VugyC+Al 「全文検索」の「全文」は、grepが対象とするところの、いわゆるプレーンテキスト
の「全文」とは、抽象度が異なるものでしょう。
の「全文」とは、抽象度が異なるものでしょう。
04/02/16 22:13ID:+Ig7jOcp
>>113-114
warata
warata
11894
04/02/16 23:55ID:jsLgsjIe04/02/17 00:08ID:h7B5N+7I
まぁ、定義は馬場さんのページに書いてあるのが
わかりやすいんでないの?
おれは辞書を使わない,わかち書きしないタイプの
インデクス作成型検索エンジンを使ってるけど。
わかりやすいんでないの?
おれは辞書を使わない,わかち書きしないタイプの
インデクス作成型検索エンジンを使ってるけど。
120login:Penguin
04/02/17 00:11ID:Xzw7cMrK 「全文検索」を細分化して概念化しておくことには意味はあるだろうね。
「完全全文検索」とかさ。
「完全全文検索」とかさ。
12194
04/02/17 01:37ID:PO7wP2QS >>119
馬場さんのページってこれですよね
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/other-system.html
私の見落としかもしれませんが、ここには全文検索システムの定義は
無いように思います。定義部分を教えてくれませんか
ちなみに「全文検索とは」でぐぐったらこんなのがありました
「漏れなく」なんてあるから私の見方に近いかも
http://www.rosei.or.jp/ISearch/help/user/japanese/is-us02/is-us007.htm
>>115さんの言うキーワード検索の用例もありました
つーか一般的な用法みたいですね失礼しました
http://www.ftsanet.com/dbtokyo02/Db02.htm
http://magazine.fujitsu.com/vol48-3/3-2.html
http://panasonic.biz/it/patlics/faq_1.html
つまり全文検索=フリーワード検索ってことでFA?
ん?それってやっぱりINDEX検索単独じゃ全文検索じゃないってことか?
詳しい方、スパっと疑問を解決してくだされ
馬場さんのページってこれですよね
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/other-system.html
私の見落としかもしれませんが、ここには全文検索システムの定義は
無いように思います。定義部分を教えてくれませんか
ちなみに「全文検索とは」でぐぐったらこんなのがありました
「漏れなく」なんてあるから私の見方に近いかも
http://www.rosei.or.jp/ISearch/help/user/japanese/is-us02/is-us007.htm
>>115さんの言うキーワード検索の用例もありました
つーか一般的な用法みたいですね失礼しました
http://www.ftsanet.com/dbtokyo02/Db02.htm
http://magazine.fujitsu.com/vol48-3/3-2.html
http://panasonic.biz/it/patlics/faq_1.html
つまり全文検索=フリーワード検索ってことでFA?
ん?それってやっぱりINDEX検索単独じゃ全文検索じゃないってことか?
詳しい方、スパっと疑問を解決してくだされ
04/02/17 21:56ID:fFyt8P5S
例えば「走る」について知りたい時は、「走った」とか「駆ける」といった単語を含む文書も
ヒットしてほしいわけです(そうではない場合もあるでしょうが)。
そのために、形態素解析、ステミング、シソーラス展開といった手法を応用している全文検索
システムも多くあります。
それらはもはやパターンの厳密な一致を探すのとは違う領域にある技術ですよね。
どっちが上とか下とか言うわけではないですが、、、
ヒットしてほしいわけです(そうではない場合もあるでしょうが)。
そのために、形態素解析、ステミング、シソーラス展開といった手法を応用している全文検索
システムも多くあります。
それらはもはやパターンの厳密な一致を探すのとは違う領域にある技術ですよね。
どっちが上とか下とか言うわけではないですが、、、
12394
04/02/17 23:42ID:PO7wP2QS >>122
そういった要望がありそれを実現するための技術があるのは分かります
で、その技術で検索幅が広がるのはいいんです。ブレるのは検索パターンの方であって検索対象はfull textですから
ただ、ここで問題にしてるのは、そういった工夫によって検索漏れが生じるようなシステムが「全文検索」の名に値するかってこと
しかも検索漏れの原因が「INDEXに検索パターンがのってない」ってことにあるなら
「それって検索対象がfull textじゃないじゃん」つまり「全文検索ではない」と思う人がいてもおかしくない
まぁ、ここ数日で「全文検索」という用語がかなり曖昧に使われているのが分かって来たんで
厳密性を求めるのは野暮ってもんでしょう。そして日経Linuxが嘲笑されたのは、まさしくこの「野暮」が原因でしょうな
実は私もあの記事を読んで最初カチンと来た。馬鹿じゃねーのとも思った
だけど上で書いたように「全文検索」をgrepと同様、検索漏れのないシステムと考える人もいるとした場合、
野暮をおしてああ書くのは親切というか、良心的なんじゃないかと思い返したわけです
そういった要望がありそれを実現するための技術があるのは分かります
で、その技術で検索幅が広がるのはいいんです。ブレるのは検索パターンの方であって検索対象はfull textですから
ただ、ここで問題にしてるのは、そういった工夫によって検索漏れが生じるようなシステムが「全文検索」の名に値するかってこと
しかも検索漏れの原因が「INDEXに検索パターンがのってない」ってことにあるなら
「それって検索対象がfull textじゃないじゃん」つまり「全文検索ではない」と思う人がいてもおかしくない
まぁ、ここ数日で「全文検索」という用語がかなり曖昧に使われているのが分かって来たんで
厳密性を求めるのは野暮ってもんでしょう。そして日経Linuxが嘲笑されたのは、まさしくこの「野暮」が原因でしょうな
実は私もあの記事を読んで最初カチンと来た。馬鹿じゃねーのとも思った
だけど上で書いたように「全文検索」をgrepと同様、検索漏れのないシステムと考える人もいるとした場合、
野暮をおしてああ書くのは親切というか、良心的なんじゃないかと思い返したわけです
12494
04/02/18 00:04ID:99PKKBxR でさ、>>122氏が言うように私の言う狭義の全文検索システムであろうがなかろうがどっちでもいいわけです
実用上は、ユーザーが特性を理解して、目的に合わせて使えば良いわけです。Namazuが有用ってことにも異義はないし
でもだったらさ「全文検索システム」と言わなくてもいいわけじゃん。「語句検索システム」とか誤解のない言い方はあると思う
(この用語はあくまで例で最適とも誤解がないとも言いませんが)
「全文検索」という用語には、そんなに魅力があるんすかねぇ
実用上は、ユーザーが特性を理解して、目的に合わせて使えば良いわけです。Namazuが有用ってことにも異義はないし
でもだったらさ「全文検索システム」と言わなくてもいいわけじゃん。「語句検索システム」とか誤解のない言い方はあると思う
(この用語はあくまで例で最適とも誤解がないとも言いませんが)
「全文検索」という用語には、そんなに魅力があるんすかねぇ
04/02/18 10:13ID:jYINYOWL
閑話提供
ttp://www.jepa.or.jp/ken/Ken_00.html
ttp://www.jepa.or.jp/ken/Ken_00.html
04/02/18 17:05ID:k8UVZXaq
繰り返しになりますが、全文検索は、
「属性やキーワードを改めて付与するなどの手間をかけずに、機械的にテキスト全体をスキャンし、
ユーザが所望の文書を捜し出す技術」
の総称なわけです。
grepの文字列探索は、全文検索を実現するにあたって実装方法の一つであることは確かです。
もちろん、予め文字列から単語を切り出してインデックスを作成する手法も、実装方法の一つです。
インデックス型の弱点として、単語の切り出し方がユーザの想定するものと違う場合に期待通りに
検索できないということがありますが、それは速度と精度のトレードオフを考えて実装上の選択を
した結果に過ぎません。つまり、「全文検索」は目的であって、実装については言及していないという
わけです。
そもそも、全文検索という語に定着した意味や用法が、自分の想定したニュアンスと違うから
といって、「お前ら間違ってるよ」的な事を言っても仕方のないことです。
「属性やキーワードを改めて付与するなどの手間をかけずに、機械的にテキスト全体をスキャンし、
ユーザが所望の文書を捜し出す技術」
の総称なわけです。
grepの文字列探索は、全文検索を実現するにあたって実装方法の一つであることは確かです。
もちろん、予め文字列から単語を切り出してインデックスを作成する手法も、実装方法の一つです。
インデックス型の弱点として、単語の切り出し方がユーザの想定するものと違う場合に期待通りに
検索できないということがありますが、それは速度と精度のトレードオフを考えて実装上の選択を
した結果に過ぎません。つまり、「全文検索」は目的であって、実装については言及していないという
わけです。
そもそも、全文検索という語に定着した意味や用法が、自分の想定したニュアンスと違うから
といって、「お前ら間違ってるよ」的な事を言っても仕方のないことです。
12794
04/02/19 09:25ID:tKKtqfPY >>126
繰り返しとか言ってるけど、そういう定義をまとめてくれたのはこのスレでは初めて聞いたよ
定義してくれたのは感謝するけど、一応
つまりあなたの定義だと「萌え語辞書」を使った「萌え語INDEX」を使ったテキスト全体をスキャンする検索システムは
何の注釈もなく全文検索システムと言っていいわけですね。何か一般に想定する全文検索システムと違う気がするけど、いいんですか?
それともこういう仕組みは「属性を改めて付与」することになるので違うってこと?
だったら何で「自立語」という属性は付与していいの?
>>「お前ら間違ってるよ」的な事を言っても仕方のないことです。
何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
結局、誤解して困るのはユーザーなんだし
繰り返しとか言ってるけど、そういう定義をまとめてくれたのはこのスレでは初めて聞いたよ
定義してくれたのは感謝するけど、一応
つまりあなたの定義だと「萌え語辞書」を使った「萌え語INDEX」を使ったテキスト全体をスキャンする検索システムは
何の注釈もなく全文検索システムと言っていいわけですね。何か一般に想定する全文検索システムと違う気がするけど、いいんですか?
それともこういう仕組みは「属性を改めて付与」することになるので違うってこと?
だったら何で「自立語」という属性は付与していいの?
>>「お前ら間違ってるよ」的な事を言っても仕方のないことです。
何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
結局、誤解して困るのはユーザーなんだし
12894
04/02/19 11:20ID:tKKtqfPY ああ勘違いしてた。Namazuでは付属語を捨てたりはしてないのか
「自立語」というのは「形態素」におきかえてくだされ。それでも文意は変わらんと思う
「自立語」というのは「形態素」におきかえてくだされ。それでも文意は変わらんと思う
129126
04/02/19 13:13ID:McDu8NC5 > 何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
> だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
> 結局、誤解して困るのはユーザーなんだし
例えるなら「スポーツカー」に厳密な定義ができないように、「全文検索」にも厳密な定義は
できないと思います。乗る人がスポーティだと思ってくれるような車はスポーツカーでいいと
思います。同じように、ユーザが対象文書の全体をスキャンしているような気分で検索できる
システムは全文検索システムと呼んでいいと思います。
もちろん、あなたの感じ方と私の感じ方は違ってあたりまえですから、私があなたの定義を
否定したりはしませんが。
> だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
> 結局、誤解して困るのはユーザーなんだし
例えるなら「スポーツカー」に厳密な定義ができないように、「全文検索」にも厳密な定義は
できないと思います。乗る人がスポーティだと思ってくれるような車はスポーツカーでいいと
思います。同じように、ユーザが対象文書の全体をスキャンしているような気分で検索できる
システムは全文検索システムと呼んでいいと思います。
もちろん、あなたの感じ方と私の感じ方は違ってあたりまえですから、私があなたの定義を
否定したりはしませんが。
04/02/19 13:25ID:wXxKmQwW
なんか俺定義な話になっているような気が…
13194
04/02/19 15:10ID:G2RVB1RM132login:Penguin
04/02/21 23:58ID:UOmOpP9E 形態素解析方式の全文検索エンジンは実用にならないってのは一般的な見解ですか?
俺的には、シビアなユースケース(特許検索とか)でなければ十分使えるというか、
大抵のケースではn-gram方式より使いやすいと思うのですが。
俺的には、シビアなユースケース(特許検索とか)でなければ十分使えるというか、
大抵のケースではn-gram方式より使いやすいと思うのですが。
133login:Penguin
04/02/22 10:16ID:xRMgLWY5 #! /bin/sh
find / -print | xargs grep $1
find / -print | xargs grep $1
04/02/22 11:48ID:/tZPZccw
富豪的というか大富豪だな(w
04/02/22 12:33ID:SU8uIsjI
>>133 なんで find なの? 普通は grep -r では?
04/02/22 13:35ID:/tZPZccw
04/07/17 16:40ID:IK/75cTR
Freya を DeleGate の中の人が改造してる模様。
http://www.delegate.org/freyasx/index-ja.shtml
http://www.delegate.org/freyasx/index-ja.shtml
138login:Penguin
04/12/16 11:44:45ID:y/5+X1zz N-gram をつかったフリーの全文検索ソフトはありませんか?
検索対象のファイル数は数千ファイルです。
検索対象のファイル数は数千ファイルです。
139login:Penguin
04/12/17 01:24:33ID:lxqlpfIe 試してないけど lucene
http://d.hatena.ne.jp/adon/20040719
http://d.hatena.ne.jp/adon/20040719
140login:Penguin
04/12/29 18:19:50ID:BRxeCRmf ウホッ、NutchもASF入りか?
http://wiki.apache.org/incubator/NutchProposal
http://wiki.apache.org/incubator/NutchProposal
141login:Penguin
05/03/01 12:58:01ID:A3PLiFVu gonzui: ソースコード検索エンジン
http://gonzui.sourceforge.net/
Rast - N-gram based full-text search system
http://www.netlab.jp/rast/
Estraierの中の人の開発メモ。Hyper Estraierを作るらしい。
http://qdbm.sourceforge.net/mikio/rbbs.cgi
http://gonzui.sourceforge.net/
Rast - N-gram based full-text search system
http://www.netlab.jp/rast/
Estraierの中の人の開発メモ。Hyper Estraierを作るらしい。
http://qdbm.sourceforge.net/mikio/rbbs.cgi
05/03/01 13:00:01ID:A3PLiFVu
関連スレ
全文検索エンジンNamazu
http://pc5.2ch.net/test/read.cgi/unix/1009715036/
全文検索エンジンEstraier
http://pc5.2ch.net/test/read.cgi/unix/1100221699/
gonzui
http://pc5.2ch.net/test/read.cgi/tech/1102086148/
全文検索エンジンNamazu
http://pc5.2ch.net/test/read.cgi/unix/1009715036/
全文検索エンジンEstraier
http://pc5.2ch.net/test/read.cgi/unix/1100221699/
gonzui
http://pc5.2ch.net/test/read.cgi/tech/1102086148/
05/03/02 14:19:57ID:s4oUhyjg
こんなの発見した
http://tech.yappo.jp/
http://tech.yappo.jp/
144login:Penguin
05/03/09 23:12:58ID:wATt7zX4 Rast 0.0.0 released
05/03/10 10:03:15ID:dSBxBqCX
朱雀、v2 リリース
ttp://hoshizawa.no-ip.com/suzaku/
ttp://hoshizawa.no-ip.com/suzaku/
05/03/10 16:27:39ID:TpfIZjXm
ruby ML 検索 powered by Rast
http://shugo.net/ruby/mlsearch.rbx
http://shugo.net/ruby/mlsearch.rbx
147login:Penguin
2005/03/23(水) 18:44:16ID:tILKfK4Q Senna 組み込み型全文検索エンジン
http://dev.razil.jp/project/senna/
http://dev.razil.jp/project/senna/
2005/03/29(火) 23:23:06ID:lx0qzo99
gonzui 1.0 released
149login:Penguin
2005/04/09(土) 10:38:27ID:+mu7EK3e 全文じゃないのですが、イメージ検索できるエンジンってないでか?
相当ググったんですが・・・やはりないんですかね?
相当ググったんですが・・・やはりないんですかね?
2005/04/09(土) 10:49:16ID:npNrboa/
>>149
試したことないけど
GNU Image-Finding Tool
http://www.gnu.org/software/gift/gift.html
イメージサーチャ for Java
http://www.sra.co.jp/people/m-asada/Isr4Java/
試したことないけど
GNU Image-Finding Tool
http://www.gnu.org/software/gift/gift.html
イメージサーチャ for Java
http://www.sra.co.jp/people/m-asada/Isr4Java/
2005/04/09(土) 22:59:57ID:+mu7EK3e
>>150
ありがとうございます。
ありがとうございます。
■ このスレッドは過去ログ倉庫に格納されています
ニュース
- 第2次大戦に触れトランプ氏「米中は同盟国」、当時は中華民国…「抗日」巡る中国の言説補強する恐れ ★5 [蚤の市★]
- 【速報】timelesz猪俣周杜メンバー釈放 [Ailuropoda melanoleuca★]
- 【速報】 高市首相 「円の過小評価は問題だ」 ★3 [お断り★]
- パナソニックが市販カーナビ生産終了へ 30年以上の歴史に幕、スマホナビの普及など受け [少考さん★]
- 【東京】ウズベキスタン国籍のフードデリバリー配達員を逮捕 配達先の女子小学生にキスや体を触るなどわいせつ行為か ★2 [煮卵★]
- 日本代表は親善試合の世界チャンピオン!?ウルグアイ撃破も海外から皮肉「W杯やアジアカップになると」日本のファン「刺さるからやめて」 [征夷大将軍★]
- 【高市悲報】未だに「年賀状」書いてる人居るでしょ🥺 [616817505]
- お前らが嫁もウッドデッキも手に入れられ部底辺独身アパートおじさんに成り果てた理由
- 【速報】声優の緒方恵美さん、長文お気持ち声明 [595118796]
- あぶない刑事の「デレレレッテ! デレレレッ!」って挿入曲あるじゃん?
- HUNATAN×HUNATANについて語るスレ(・o・🍬)🏰
- 【悲報】ジャングリア沖縄、ガラガラすぎてガチのジャングルになる [398059782]