オープンソースの全文検索エンジン全般を扱うスレッドです。
ソフトウェアによっては固有のスレッドが立てられている場合もあります。
それらについては適宜リンクを張ります。
Namazu http://www.namazu.org/
Glimpse http://webglimpse.org/
SWISH++ http://homepage.mac.com/pauljlucas/software/swish/
ht:/Dig http://www.htdig.org/
Comparing Open Source Indexers
http://www.infomotions.com/musings/opensource-indexers/
関連スレッド
全文検索ユーティリティ統一スレッド
http://pc.2ch.net/test/read.cgi/bsoft/1006680403/
ビジネスソフト板のスレッドです。
主に Windows のパッケージソフトについてのようです。
Microsoftの全文検索ソフト(Indexing Service等)
http://pc3.2ch.net/test/read.cgi/win/1035387243/
オープンソースの全文検索ソフト
■ このスレッドは過去ログ倉庫に格納されています
1はるお
02/11/01 03:28ID:5yfQC/Z+116login:Penguin
04/02/16 22:06ID:VugyC+Al 「全文検索」の「全文」は、grepが対象とするところの、いわゆるプレーンテキスト
の「全文」とは、抽象度が異なるものでしょう。
の「全文」とは、抽象度が異なるものでしょう。
04/02/16 22:13ID:+Ig7jOcp
>>113-114
warata
warata
11894
04/02/16 23:55ID:jsLgsjIe04/02/17 00:08ID:h7B5N+7I
まぁ、定義は馬場さんのページに書いてあるのが
わかりやすいんでないの?
おれは辞書を使わない,わかち書きしないタイプの
インデクス作成型検索エンジンを使ってるけど。
わかりやすいんでないの?
おれは辞書を使わない,わかち書きしないタイプの
インデクス作成型検索エンジンを使ってるけど。
120login:Penguin
04/02/17 00:11ID:Xzw7cMrK 「全文検索」を細分化して概念化しておくことには意味はあるだろうね。
「完全全文検索」とかさ。
「完全全文検索」とかさ。
12194
04/02/17 01:37ID:PO7wP2QS >>119
馬場さんのページってこれですよね
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/other-system.html
私の見落としかもしれませんが、ここには全文検索システムの定義は
無いように思います。定義部分を教えてくれませんか
ちなみに「全文検索とは」でぐぐったらこんなのがありました
「漏れなく」なんてあるから私の見方に近いかも
http://www.rosei.or.jp/ISearch/help/user/japanese/is-us02/is-us007.htm
>>115さんの言うキーワード検索の用例もありました
つーか一般的な用法みたいですね失礼しました
http://www.ftsanet.com/dbtokyo02/Db02.htm
http://magazine.fujitsu.com/vol48-3/3-2.html
http://panasonic.biz/it/patlics/faq_1.html
つまり全文検索=フリーワード検索ってことでFA?
ん?それってやっぱりINDEX検索単独じゃ全文検索じゃないってことか?
詳しい方、スパっと疑問を解決してくだされ
馬場さんのページってこれですよね
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/
http://www.kusastro.kyoto-u.ac.jp/~baba/wais/other-system.html
私の見落としかもしれませんが、ここには全文検索システムの定義は
無いように思います。定義部分を教えてくれませんか
ちなみに「全文検索とは」でぐぐったらこんなのがありました
「漏れなく」なんてあるから私の見方に近いかも
http://www.rosei.or.jp/ISearch/help/user/japanese/is-us02/is-us007.htm
>>115さんの言うキーワード検索の用例もありました
つーか一般的な用法みたいですね失礼しました
http://www.ftsanet.com/dbtokyo02/Db02.htm
http://magazine.fujitsu.com/vol48-3/3-2.html
http://panasonic.biz/it/patlics/faq_1.html
つまり全文検索=フリーワード検索ってことでFA?
ん?それってやっぱりINDEX検索単独じゃ全文検索じゃないってことか?
詳しい方、スパっと疑問を解決してくだされ
04/02/17 21:56ID:fFyt8P5S
例えば「走る」について知りたい時は、「走った」とか「駆ける」といった単語を含む文書も
ヒットしてほしいわけです(そうではない場合もあるでしょうが)。
そのために、形態素解析、ステミング、シソーラス展開といった手法を応用している全文検索
システムも多くあります。
それらはもはやパターンの厳密な一致を探すのとは違う領域にある技術ですよね。
どっちが上とか下とか言うわけではないですが、、、
ヒットしてほしいわけです(そうではない場合もあるでしょうが)。
そのために、形態素解析、ステミング、シソーラス展開といった手法を応用している全文検索
システムも多くあります。
それらはもはやパターンの厳密な一致を探すのとは違う領域にある技術ですよね。
どっちが上とか下とか言うわけではないですが、、、
12394
04/02/17 23:42ID:PO7wP2QS >>122
そういった要望がありそれを実現するための技術があるのは分かります
で、その技術で検索幅が広がるのはいいんです。ブレるのは検索パターンの方であって検索対象はfull textですから
ただ、ここで問題にしてるのは、そういった工夫によって検索漏れが生じるようなシステムが「全文検索」の名に値するかってこと
しかも検索漏れの原因が「INDEXに検索パターンがのってない」ってことにあるなら
「それって検索対象がfull textじゃないじゃん」つまり「全文検索ではない」と思う人がいてもおかしくない
まぁ、ここ数日で「全文検索」という用語がかなり曖昧に使われているのが分かって来たんで
厳密性を求めるのは野暮ってもんでしょう。そして日経Linuxが嘲笑されたのは、まさしくこの「野暮」が原因でしょうな
実は私もあの記事を読んで最初カチンと来た。馬鹿じゃねーのとも思った
だけど上で書いたように「全文検索」をgrepと同様、検索漏れのないシステムと考える人もいるとした場合、
野暮をおしてああ書くのは親切というか、良心的なんじゃないかと思い返したわけです
そういった要望がありそれを実現するための技術があるのは分かります
で、その技術で検索幅が広がるのはいいんです。ブレるのは検索パターンの方であって検索対象はfull textですから
ただ、ここで問題にしてるのは、そういった工夫によって検索漏れが生じるようなシステムが「全文検索」の名に値するかってこと
しかも検索漏れの原因が「INDEXに検索パターンがのってない」ってことにあるなら
「それって検索対象がfull textじゃないじゃん」つまり「全文検索ではない」と思う人がいてもおかしくない
まぁ、ここ数日で「全文検索」という用語がかなり曖昧に使われているのが分かって来たんで
厳密性を求めるのは野暮ってもんでしょう。そして日経Linuxが嘲笑されたのは、まさしくこの「野暮」が原因でしょうな
実は私もあの記事を読んで最初カチンと来た。馬鹿じゃねーのとも思った
だけど上で書いたように「全文検索」をgrepと同様、検索漏れのないシステムと考える人もいるとした場合、
野暮をおしてああ書くのは親切というか、良心的なんじゃないかと思い返したわけです
12494
04/02/18 00:04ID:99PKKBxR でさ、>>122氏が言うように私の言う狭義の全文検索システムであろうがなかろうがどっちでもいいわけです
実用上は、ユーザーが特性を理解して、目的に合わせて使えば良いわけです。Namazuが有用ってことにも異義はないし
でもだったらさ「全文検索システム」と言わなくてもいいわけじゃん。「語句検索システム」とか誤解のない言い方はあると思う
(この用語はあくまで例で最適とも誤解がないとも言いませんが)
「全文検索」という用語には、そんなに魅力があるんすかねぇ
実用上は、ユーザーが特性を理解して、目的に合わせて使えば良いわけです。Namazuが有用ってことにも異義はないし
でもだったらさ「全文検索システム」と言わなくてもいいわけじゃん。「語句検索システム」とか誤解のない言い方はあると思う
(この用語はあくまで例で最適とも誤解がないとも言いませんが)
「全文検索」という用語には、そんなに魅力があるんすかねぇ
04/02/18 10:13ID:jYINYOWL
閑話提供
ttp://www.jepa.or.jp/ken/Ken_00.html
ttp://www.jepa.or.jp/ken/Ken_00.html
04/02/18 17:05ID:k8UVZXaq
繰り返しになりますが、全文検索は、
「属性やキーワードを改めて付与するなどの手間をかけずに、機械的にテキスト全体をスキャンし、
ユーザが所望の文書を捜し出す技術」
の総称なわけです。
grepの文字列探索は、全文検索を実現するにあたって実装方法の一つであることは確かです。
もちろん、予め文字列から単語を切り出してインデックスを作成する手法も、実装方法の一つです。
インデックス型の弱点として、単語の切り出し方がユーザの想定するものと違う場合に期待通りに
検索できないということがありますが、それは速度と精度のトレードオフを考えて実装上の選択を
した結果に過ぎません。つまり、「全文検索」は目的であって、実装については言及していないという
わけです。
そもそも、全文検索という語に定着した意味や用法が、自分の想定したニュアンスと違うから
といって、「お前ら間違ってるよ」的な事を言っても仕方のないことです。
「属性やキーワードを改めて付与するなどの手間をかけずに、機械的にテキスト全体をスキャンし、
ユーザが所望の文書を捜し出す技術」
の総称なわけです。
grepの文字列探索は、全文検索を実現するにあたって実装方法の一つであることは確かです。
もちろん、予め文字列から単語を切り出してインデックスを作成する手法も、実装方法の一つです。
インデックス型の弱点として、単語の切り出し方がユーザの想定するものと違う場合に期待通りに
検索できないということがありますが、それは速度と精度のトレードオフを考えて実装上の選択を
した結果に過ぎません。つまり、「全文検索」は目的であって、実装については言及していないという
わけです。
そもそも、全文検索という語に定着した意味や用法が、自分の想定したニュアンスと違うから
といって、「お前ら間違ってるよ」的な事を言っても仕方のないことです。
12794
04/02/19 09:25ID:tKKtqfPY >>126
繰り返しとか言ってるけど、そういう定義をまとめてくれたのはこのスレでは初めて聞いたよ
定義してくれたのは感謝するけど、一応
つまりあなたの定義だと「萌え語辞書」を使った「萌え語INDEX」を使ったテキスト全体をスキャンする検索システムは
何の注釈もなく全文検索システムと言っていいわけですね。何か一般に想定する全文検索システムと違う気がするけど、いいんですか?
それともこういう仕組みは「属性を改めて付与」することになるので違うってこと?
だったら何で「自立語」という属性は付与していいの?
>>「お前ら間違ってるよ」的な事を言っても仕方のないことです。
何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
結局、誤解して困るのはユーザーなんだし
繰り返しとか言ってるけど、そういう定義をまとめてくれたのはこのスレでは初めて聞いたよ
定義してくれたのは感謝するけど、一応
つまりあなたの定義だと「萌え語辞書」を使った「萌え語INDEX」を使ったテキスト全体をスキャンする検索システムは
何の注釈もなく全文検索システムと言っていいわけですね。何か一般に想定する全文検索システムと違う気がするけど、いいんですか?
それともこういう仕組みは「属性を改めて付与」することになるので違うってこと?
だったら何で「自立語」という属性は付与していいの?
>>「お前ら間違ってるよ」的な事を言っても仕方のないことです。
何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
結局、誤解して困るのはユーザーなんだし
12894
04/02/19 11:20ID:tKKtqfPY ああ勘違いしてた。Namazuでは付属語を捨てたりはしてないのか
「自立語」というのは「形態素」におきかえてくだされ。それでも文意は変わらんと思う
「自立語」というのは「形態素」におきかえてくだされ。それでも文意は変わらんと思う
129126
04/02/19 13:13ID:McDu8NC5 > 何だかんだ言ってるけど、私も全文検索システムの解釈にブレがあるのは理解してるわけよ
> だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
> 結局、誤解して困るのはユーザーなんだし
例えるなら「スポーツカー」に厳密な定義ができないように、「全文検索」にも厳密な定義は
できないと思います。乗る人がスポーティだと思ってくれるような車はスポーツカーでいいと
思います。同じように、ユーザが対象文書の全体をスキャンしているような気分で検索できる
システムは全文検索システムと呼んでいいと思います。
もちろん、あなたの感じ方と私の感じ方は違ってあたりまえですから、私があなたの定義を
否定したりはしませんが。
> だったらさ誤解がないように、より厳密な用語を使って行こうという気はないの?
> 結局、誤解して困るのはユーザーなんだし
例えるなら「スポーツカー」に厳密な定義ができないように、「全文検索」にも厳密な定義は
できないと思います。乗る人がスポーティだと思ってくれるような車はスポーツカーでいいと
思います。同じように、ユーザが対象文書の全体をスキャンしているような気分で検索できる
システムは全文検索システムと呼んでいいと思います。
もちろん、あなたの感じ方と私の感じ方は違ってあたりまえですから、私があなたの定義を
否定したりはしませんが。
04/02/19 13:25ID:wXxKmQwW
なんか俺定義な話になっているような気が…
13194
04/02/19 15:10ID:G2RVB1RM132login:Penguin
04/02/21 23:58ID:UOmOpP9E 形態素解析方式の全文検索エンジンは実用にならないってのは一般的な見解ですか?
俺的には、シビアなユースケース(特許検索とか)でなければ十分使えるというか、
大抵のケースではn-gram方式より使いやすいと思うのですが。
俺的には、シビアなユースケース(特許検索とか)でなければ十分使えるというか、
大抵のケースではn-gram方式より使いやすいと思うのですが。
133login:Penguin
04/02/22 10:16ID:xRMgLWY5 #! /bin/sh
find / -print | xargs grep $1
find / -print | xargs grep $1
04/02/22 11:48ID:/tZPZccw
富豪的というか大富豪だな(w
04/02/22 12:33ID:SU8uIsjI
>>133 なんで find なの? 普通は grep -r では?
04/02/22 13:35ID:/tZPZccw
04/07/17 16:40ID:IK/75cTR
Freya を DeleGate の中の人が改造してる模様。
http://www.delegate.org/freyasx/index-ja.shtml
http://www.delegate.org/freyasx/index-ja.shtml
138login:Penguin
04/12/16 11:44:45ID:y/5+X1zz N-gram をつかったフリーの全文検索ソフトはありませんか?
検索対象のファイル数は数千ファイルです。
検索対象のファイル数は数千ファイルです。
139login:Penguin
04/12/17 01:24:33ID:lxqlpfIe 試してないけど lucene
http://d.hatena.ne.jp/adon/20040719
http://d.hatena.ne.jp/adon/20040719
140login:Penguin
04/12/29 18:19:50ID:BRxeCRmf ウホッ、NutchもASF入りか?
http://wiki.apache.org/incubator/NutchProposal
http://wiki.apache.org/incubator/NutchProposal
141login:Penguin
05/03/01 12:58:01ID:A3PLiFVu gonzui: ソースコード検索エンジン
http://gonzui.sourceforge.net/
Rast - N-gram based full-text search system
http://www.netlab.jp/rast/
Estraierの中の人の開発メモ。Hyper Estraierを作るらしい。
http://qdbm.sourceforge.net/mikio/rbbs.cgi
http://gonzui.sourceforge.net/
Rast - N-gram based full-text search system
http://www.netlab.jp/rast/
Estraierの中の人の開発メモ。Hyper Estraierを作るらしい。
http://qdbm.sourceforge.net/mikio/rbbs.cgi
05/03/01 13:00:01ID:A3PLiFVu
関連スレ
全文検索エンジンNamazu
http://pc5.2ch.net/test/read.cgi/unix/1009715036/
全文検索エンジンEstraier
http://pc5.2ch.net/test/read.cgi/unix/1100221699/
gonzui
http://pc5.2ch.net/test/read.cgi/tech/1102086148/
全文検索エンジンNamazu
http://pc5.2ch.net/test/read.cgi/unix/1009715036/
全文検索エンジンEstraier
http://pc5.2ch.net/test/read.cgi/unix/1100221699/
gonzui
http://pc5.2ch.net/test/read.cgi/tech/1102086148/
05/03/02 14:19:57ID:s4oUhyjg
こんなの発見した
http://tech.yappo.jp/
http://tech.yappo.jp/
144login:Penguin
05/03/09 23:12:58ID:wATt7zX4 Rast 0.0.0 released
05/03/10 10:03:15ID:dSBxBqCX
朱雀、v2 リリース
ttp://hoshizawa.no-ip.com/suzaku/
ttp://hoshizawa.no-ip.com/suzaku/
05/03/10 16:27:39ID:TpfIZjXm
ruby ML 検索 powered by Rast
http://shugo.net/ruby/mlsearch.rbx
http://shugo.net/ruby/mlsearch.rbx
147login:Penguin
2005/03/23(水) 18:44:16ID:tILKfK4Q Senna 組み込み型全文検索エンジン
http://dev.razil.jp/project/senna/
http://dev.razil.jp/project/senna/
2005/03/29(火) 23:23:06ID:lx0qzo99
gonzui 1.0 released
149login:Penguin
2005/04/09(土) 10:38:27ID:+mu7EK3e 全文じゃないのですが、イメージ検索できるエンジンってないでか?
相当ググったんですが・・・やはりないんですかね?
相当ググったんですが・・・やはりないんですかね?
2005/04/09(土) 10:49:16ID:npNrboa/
>>149
試したことないけど
GNU Image-Finding Tool
http://www.gnu.org/software/gift/gift.html
イメージサーチャ for Java
http://www.sra.co.jp/people/m-asada/Isr4Java/
試したことないけど
GNU Image-Finding Tool
http://www.gnu.org/software/gift/gift.html
イメージサーチャ for Java
http://www.sra.co.jp/people/m-asada/Isr4Java/
2005/04/09(土) 22:59:57ID:+mu7EK3e
>>150
ありがとうございます。
ありがとうございます。
152login:Penguin
2005/04/14(木) 16:05:44ID:u3OwVqgq 4 名前:仕様書無しさん[] 投稿者:2005/04/12(火) 00:17:42
blogWatcher
http://www.lr.pi.titech.ac.jp/blogwatcher/blog/
が検索エンジンを情報処理振興事業協会(IPA)が実施した
「独創的情報技術育成事業」の研究成果であるGETAから
オープンソースで開発されているLuceneに変更したのは
GETAが税金を無駄にしただけの糞で鈍間で役立たずの
ポンコツだと言うことですか?
blogWatcher
http://www.lr.pi.titech.ac.jp/blogwatcher/blog/
が検索エンジンを情報処理振興事業協会(IPA)が実施した
「独創的情報技術育成事業」の研究成果であるGETAから
オープンソースで開発されているLuceneに変更したのは
GETAが税金を無駄にしただけの糞で鈍間で役立たずの
ポンコツだと言うことですか?
2005/04/20(水) 18:15:48ID:lbPp4dex
心無いこと言うなよ。
2005/05/06(金) 08:37:21ID:lI2CCtV2
Namazuだと、全然文字が引っ掛からない(INDEX作成にはkakashi, chasen,
どちらも使ってみました)のです…
INDEX自体はまともに作成されてるようなのですが、
そもそも、適切に分ち書きできてないみたいです。
何か設定を変更することで上手く行くようになりますでしょうか。
どちらも使ってみました)のです…
INDEX自体はまともに作成されてるようなのですが、
そもそも、適切に分ち書きできてないみたいです。
何か設定を変更することで上手く行くようになりますでしょうか。
2005/05/06(金) 10:31:42ID:AlEjD5fH
mknmz -L jaでインデックス作るとどうよ。
2005/05/07(土) 10:44:20ID:WnWxEbDH
>>154 LANGUAGE とか LC_ALL の環境変数が ja になってないと
日本語keyword 正しく生成しないんだが、その話しか?
日本語keyword 正しく生成しないんだが、その話しか?
2005/06/19(日) 18:11:43ID:8H2hS4Uc
GETAって説明見るかぎりではよさげだけど
158login:Penguin
2005/07/01(金) 11:04:42ID:yhjcuNWo >>156
知識が古い
知識が古い
2005/07/01(金) 11:36:50ID:l6AY3eSM
>>158
そうなの?今はどうなの?
そうなの?今はどうなの?
2005/07/01(金) 12:15:01ID:yhjcuNWo
2005/07/01(金) 20:09:16ID:5zVf7Ksr
たしかに煽りだけのアホにはあきれる罠
2005/07/03(日) 22:55:14ID:z6TH4X8n
2005/09/06(火) 15:27:32ID:fQOUQlk6
rast ML 発見
http://www.netlab.jp/rast/index.html.ja#label-12
rast 0.3.0 もリリースされてます
http://www.j96.org/w3ml/rast-ja/msg/2
あと matz 氏の morq もついに公開されたようですが…
debian sid な環境ですが動かすことはできず。orz
http://www.netlab.jp/rast/index.html.ja#label-12
rast 0.3.0 もリリースされてます
http://www.j96.org/w3ml/rast-ja/msg/2
あと matz 氏の morq もついに公開されたようですが…
debian sid な環境ですが動かすことはできず。orz
164login:Penguin
2005/10/20(木) 15:33:40ID:gTZ54A3C gdestraierの使用レポきぼんぬ。
165login:Penguin
2005/11/07(月) 22:23:25ID:1VrgDytv luceneってむちゃくちゃよくね?
小規模なら、何も考えずに使えるし、
日本語もそのまま通る。
俺何か見逃してるかなぁ。
小規模なら、何も考えずに使えるし、
日本語もそのまま通る。
俺何か見逃してるかなぁ。
2005/11/08(火) 10:13:48ID:pE5I1Nnu
2005/12/03(土) 04:02:20ID:/hc4pm5p
>>165
小規模ならいいけど、大規模(10万件以上)だとめちゃくちゃ遅い
小規模ならいいけど、大規模(10万件以上)だとめちゃくちゃ遅い
168login:Penguin
2005/12/03(土) 13:05:12ID:SsJtQiWj >>167 何か設定やらチューンやらできないの?
2005/12/04(日) 22:15:43ID:LqLx7hy3
2005/12/05(月) 09:54:08ID:gHetzDlJ
Nutchってその辺どうしてるんだろ?
171login:Penguin
2006/01/08(日) 13:08:32ID:/SfDDqW0 なまずがもうすぐバージョンアップするって本当?
2006/01/30(月) 18:44:33ID:OupapdHM
>>171
きたよ
きたよ
2006/02/24(金) 12:47:39ID:VEoUF2uq
>>166
LuceneはC#へのポーティングがあるな。
LuceneはC#へのポーティングがあるな。
174login:Penguin
2006/12/19(火) 08:51:48ID:H/fR0rQV で、世の中 Google Desktop Search とか Spotlight が当たり前になってる今、
みなさん最近は何使ってんの?
みなさん最近は何使ってんの?
175名無しさん@お腹いっぱい
2006/12/19(火) 10:12:39ID:9M7VxUKD176age
2007/01/16(火) 23:04:15ID:sCPN49tb ご存知の方おられたら教えてください。
Nutchは、AnalyzerにデフォルトでNutchAnalyzerを使っていて、
日本語はインデックス作成時に(クエリー処理時も)1文字ずつに
分解されてしまいます。そこで、bigramでインデックスを張れる
CJKAnalyzerを利用しようかと思ったのですが、nutchのソース修正が
必要でしょうか?
Nutchは、AnalyzerにデフォルトでNutchAnalyzerを使っていて、
日本語はインデックス作成時に(クエリー処理時も)1文字ずつに
分解されてしまいます。そこで、bigramでインデックスを張れる
CJKAnalyzerを利用しようかと思ったのですが、nutchのソース修正が
必要でしょうか?
177age
2007/01/16(火) 23:05:32ID:sCPN49tb pluginをいじるだけでできるかと調べたのですが、
なにぶんドキュメントが少なくて、よくわかりませんでした...。
なにぶんドキュメントが少なくて、よくわかりませんでした...。
2007/01/21(日) 22:34:31ID:cbvQ8w/u
ttp://wiki.apache.org/nutch/MultiLingualSupport
ttp://mail-archives.apache.org/mod_mbox/lucene-nutch-dev/200606.mbox/%[email protected]%3E
ttp://mail-archives.apache.org/mod_mbox/lucene-nutch-dev/200606.mbox/%[email protected]%3E
2007/01/31(水) 10:26:20ID:9FAAVXiR
Google や Yahoo! がやっているような、表記揺れの展開をやってみたいのですが、
全文検索ソフトと併用できるような便利な表記揺れ展開用の辞書かライブラリってあるのでしょうか。
それとも自分で辞書を作らなければならないのでしょうか。
代用漢字、異体字、カタカナ語、送り仮名、検索ワードの誤り、略称、関連語など、
考え出すときりがないとも言えるのですが…
企業向けの商用ソフト(の形態素解析ソフトのおまけ?)にはあるらしいことは一応わかってきました。
なにかアドバイスください。
全文検索ソフトと併用できるような便利な表記揺れ展開用の辞書かライブラリってあるのでしょうか。
それとも自分で辞書を作らなければならないのでしょうか。
代用漢字、異体字、カタカナ語、送り仮名、検索ワードの誤り、略称、関連語など、
考え出すときりがないとも言えるのですが…
企業向けの商用ソフト(の形態素解析ソフトのおまけ?)にはあるらしいことは一応わかってきました。
なにかアドバイスください。
180login:Penguin
2007/02/01(木) 15:07:34ID:OTOWAPaF >>179
どこかの国立の日本語研究所が表記揺らぎ辞書を公開してたよ。
どこかの国立の日本語研究所が表記揺らぎ辞書を公開してたよ。
181179
2007/02/01(木) 16:59:00ID:93ds0frc 国立国語研究所の「表記統合辞書」ですね。ありがとうございます。
kokken.go.jp がつながりにくいようですが…
必要に応じて電話で問い合わせしてみようかしら。
kokken.go.jp がつながりにくいようですが…
必要に応じて電話で問い合わせしてみようかしら。
2007/02/02(金) 10:56:10ID:RbpAhOyB
風博士ではRastが死亡認定された模様。
2007/02/08(木) 09:58:55ID:lffkdWu+
html内で、コメントを使わずにスタイルシートのhiddenを使ってコメントアウトしているページがあり
NAMAZUはもちろん対応していないのですが、対応できる検索エンジンってあります?
NAMAZUはもちろん対応していないのですが、対応できる検索エンジンってあります?
2007/02/08(木) 15:30:47ID:aalcJ7Z4
多分ない。
2007/02/08(木) 15:43:02ID:lffkdWu+
>>184
そうですよね。googleでも引っかかってしまうし。
そうですよね。googleでも引っかかってしまうし。
2007/02/08(木) 22:54:22ID:WBqU/6bx
対応ってどういう意味だろう。
そこが検索でヒットされて欲しくないってこと?
そんなエンジンはないだろうな。
そこが検索でヒットされて欲しくないってこと?
そんなエンジンはないだろうな。
187login:Penguin
2007/02/08(木) 23:29:33ID:xQE/x50H 対応できるってどういう意味だろう。
「作ればあるもん」だと思うのだが。
「作ればあるもん」だと思うのだが。
188login:Penguin
2007/02/13(火) 16:54:43ID:g+G6znAU rastって死亡? なんか実質1年くらい動きがなさそうなんだけど。
matzがいるような会社でも、IPAから金めぐんでもらってやってただけで
それがなくなったら後は野となれ山となれなのかね? もしそうだったら寂しいね。
matzがいるような会社でも、IPAから金めぐんでもらってやってただけで
それがなくなったら後は野となれ山となれなのかね? もしそうだったら寂しいね。
189login:Penguin
2007/02/13(火) 18:46:26ID:JrXWD7sx >>188
長い目で見れば、死亡させた方が金になるんだよ。
長い目で見れば、死亡させた方が金になるんだよ。
2007/02/14(水) 07:47:29ID:/l3toK3t
Hyper Estarierは未踏で開発が加速して、今はまったりとしつつも
きちんと続いている。
SennaもMySQL連携が効いたのか、じわじわと利用が進んでいる。
Rastはなあ... 構造を複雑にしすぎて、金が切れてからのメンテナンスが
難しくなったんじゃないかという気がする。あとは外部からの開発者を
集められなかったことが敗因か。
きちんと続いている。
SennaもMySQL連携が効いたのか、じわじわと利用が進んでいる。
Rastはなあ... 構造を複雑にしすぎて、金が切れてからのメンテナンスが
難しくなったんじゃないかという気がする。あとは外部からの開発者を
集められなかったことが敗因か。
2007/02/14(水) 09:45:36ID:URN3dXTi
H.E. も個人開発だけどね
192login:Penguin
2007/02/14(水) 13:13:18ID:fQFyeH6h >>190
> 難しくなったんじゃないかという気がする。あとは外部からの開発者を
> 集められなかったことが敗因か。
いや〜
金をもらって作られたブツの世話を引き継いで、タダで作業するのって、惨めだぞ〜
特に多大な金が投入されたことをみんなが知っていると、いろいろあって鬱病になりそうになる。
もう2度とやりたくない。
> 難しくなったんじゃないかという気がする。あとは外部からの開発者を
> 集められなかったことが敗因か。
いや〜
金をもらって作られたブツの世話を引き継いで、タダで作業するのって、惨めだぞ〜
特に多大な金が投入されたことをみんなが知っていると、いろいろあって鬱病になりそうになる。
もう2度とやりたくない。
2007/02/15(木) 11:59:16ID:vlsOl9z9
194login:Penguin
2007/07/12(木) 15:36:46ID:FQfZ6HrX195login:Penguin
2007/08/28(火) 03:01:56ID:AfUQD9wn 人少ないみたいだからアゲますね。
ちょっとダサい質問なんですが、インデックスを作成するタイプの全文検索で
そのものがインストールされていないレンタル鯖で使えるものってありますか?
PerlもしくはRubyから検索したいと思って
Namazu、HyperEstraierを試したんですが、
前者はPerlモジュールのインストールを断られ、
後者はインデックスがQDBMの形式だからどの道無理かと思いました。
(方法があればHEの方は使ってみたいけど)
頻繁に更新されるような対象じゃないので、MySQLのFULLTEXTでも・・・
と思ってはいるんだけど、
なにか方法(ソフト)があればおしえてください。
ちょっとダサい質問なんですが、インデックスを作成するタイプの全文検索で
そのものがインストールされていないレンタル鯖で使えるものってありますか?
PerlもしくはRubyから検索したいと思って
Namazu、HyperEstraierを試したんですが、
前者はPerlモジュールのインストールを断られ、
後者はインデックスがQDBMの形式だからどの道無理かと思いました。
(方法があればHEの方は使ってみたいけど)
頻繁に更新されるような対象じゃないので、MySQLのFULLTEXTでも・・・
と思ってはいるんだけど、
なにか方法(ソフト)があればおしえてください。
196login:Penguin
2007/08/28(火) 08:03:34ID:NA5riCTs http://rubyforge.org/projects/ferret/
pure rubyでこんなのがあるよ。日本語が使えるかどうかはわからないけど。
Luceneにinspreされたとかいてあるから、UTF-8なら使えそうな気もする。
pure rubyでこんなのがあるよ。日本語が使えるかどうかはわからないけど。
Luceneにinspreされたとかいてあるから、UTF-8なら使えそうな気もする。
197195
2007/08/28(火) 20:02:17ID:uwrt1akO >>196
少し触ってみたところ使いやすい感じで好感触でした!
完全かどうかはわかりませんが、日本語も大丈夫でした。
とりあえずレン鯖での動作も確認できました。
まだ不明な点もありますが、しばらく使ってみようと思います。
ありがとうございました!
少し触ってみたところ使いやすい感じで好感触でした!
完全かどうかはわかりませんが、日本語も大丈夫でした。
とりあえずレン鯖での動作も確認できました。
まだ不明な点もありますが、しばらく使ってみようと思います。
ありがとうございました!
2008/01/08(火) 00:46:08ID:XSbSibRZ
gonzuiみたいなのでVB6検索できるエンジンありませんかね?
VB6病発病したソースコードを手術しないといけないので
頼みます。
VB6病発病したソースコードを手術しないといけないので
頼みます。
199login:Penguin
2008/04/09(水) 00:25:01ID:X4T3aWgW こんなん出てた。
全文検索エンジンLux
http://luxse.sourceforge.net/
ToDo のところに
# 削除・更新
# 全角半角かなの同一視
とか書いてあるあたり見ると、まだ全然未完成みたいだけど。
全文検索エンジンLux
http://luxse.sourceforge.net/
ToDo のところに
# 削除・更新
# 全角半角かなの同一視
とか書いてあるあたり見ると、まだ全然未完成みたいだけど。
2008/04/09(水) 13:25:32ID:P7VWxNnr
apacheのluceneがeclipseのヘルプ?で使われていたことを知った。
201login:Penguin
2008/09/08(月) 17:32:23ID:NVWE6wto InfoCrawlerとOmniFindってどう?
今研究室の文書管理システムを作らなきゃいけないんだが,ユーザビリティを損なわず文書管理したい.
ファイルドラッグできるフリーなシステムは見つからない.
⇒Sambaフォルダに適当にぶち込んで後から見るときは検索でおk
と言う風に今は考えてるんだが、間違ってないよな?
doc,pdf,ppt辺りを読み込んでくれる素敵なエンジンはない物か…
今研究室の文書管理システムを作らなきゃいけないんだが,ユーザビリティを損なわず文書管理したい.
ファイルドラッグできるフリーなシステムは見つからない.
⇒Sambaフォルダに適当にぶち込んで後から見るときは検索でおk
と言う風に今は考えてるんだが、間違ってないよな?
doc,pdf,ppt辺りを読み込んでくれる素敵なエンジンはない物か…
202login:Penguin
2008/11/20(木) 11:23:32ID:rg5Oz6Z5 保守
203login:Penguin
2008/11/29(土) 10:11:46ID:lHYI9aEV2009/12/23(水) 12:09:55ID:2EkpDgwW
ど素人の質問で申し訳ないんですが、
ひらがな/カタカナのどちらでも検索可能にしたい場合、
「検索時に、両方のキーワードで検索する」案と、
「インデックス自体を、両方作っておく」案の、どちらが検索時間が短くすむのでしょうか?
(検証しろと言われれば、それまでなんですが)
私の事情的には、「大差はない」というのが理想ですが、
どうなんでしょうか?
ちなみに、使ってるのはLucene(2.3.2かな)で、すでに運用開始している状態です。
ひらがな/カタカナのどちらでも検索可能にしたい場合、
「検索時に、両方のキーワードで検索する」案と、
「インデックス自体を、両方作っておく」案の、どちらが検索時間が短くすむのでしょうか?
(検証しろと言われれば、それまでなんですが)
私の事情的には、「大差はない」というのが理想ですが、
どうなんでしょうか?
ちなみに、使ってるのはLucene(2.3.2かな)で、すでに運用開始している状態です。
2009/12/23(水) 12:50:29ID:hw50+bfV
常にひらがな/カタカナのどちらでも検索していいなら、
インデックス作るときに、どっちかにまとめてしまうな。
あとは、検索時に指定されたのを同じルールで処理してから検索。
データが小さくなるし、analyzerでこの処理をさせれば、
本文はそのままだから、取り出し可能にもできるし。
インデックス作るときに、どっちかにまとめてしまうな。
あとは、検索時に指定されたのを同じルールで処理してから検索。
データが小さくなるし、analyzerでこの処理をさせれば、
本文はそのままだから、取り出し可能にもできるし。
2009/12/23(水) 13:01:14ID:hw50+bfV
あと、データ量と同時検索数次第な気がするけど、
両方のキーワードで検索した方が速いと思うよ。
インデックスを小さくしておいた方が速いと思う。
ひらがな/カタカナ混じりだったらどうするとか考えると、
統一しちゃう方が簡単だと思うんだよなー。
検索用フィールドをいくつか作るのはありかもね。
平仮名片仮名を無視する検索用はどちらかに統一して、
そうじゃない方はそのまま入れておく。
両方のキーワードで検索した方が速いと思うよ。
インデックスを小さくしておいた方が速いと思う。
ひらがな/カタカナ混じりだったらどうするとか考えると、
統一しちゃう方が簡単だと思うんだよなー。
検索用フィールドをいくつか作るのはありかもね。
平仮名片仮名を無視する検索用はどちらかに統一して、
そうじゃない方はそのまま入れておく。
2009/12/24(木) 14:55:08ID:pQ+PzKun
>>206
レスありがとうございます。
やはり「INDEXも検索も統一」というのが良さそうですね。
ただ、すでに運用してるシステムでして、
根本から作り直すことになると、コストやリソースの関係で、
お客様の希望する時期に出せそうになかったもので、
質問のような小手先の対応を考えていました。
レスありがとうございます。
やはり「INDEXも検索も統一」というのが良さそうですね。
ただ、すでに運用してるシステムでして、
根本から作り直すことになると、コストやリソースの関係で、
お客様の希望する時期に出せそうになかったもので、
質問のような小手先の対応を考えていました。
2011/10/26(水) 09:08:10.23ID:u1Edo4nm
dpkgとzeitgeistがXapianっていう全文検索ソフトを使っているけれどあれは何?
対応言語に日本語は入っていないみたい
対応言語に日本語は入っていないみたい
209login:Penguin
2011/12/11(日) 16:26:21.87ID:jX1ksO4u 「俺の全文検索」のソースをアップロードした。
http://www.ne.jp/asahi/sun/patagonia/fulltext/fulltext.html
うまく全文検索できないときには掲示板に書きこんでくれ。
http://www.ne.jp/asahi/sun/patagonia/fulltext/fulltext.html
うまく全文検索できないときには掲示板に書きこんでくれ。
2011/12/11(日) 16:52:48.77ID:SGJMDI+x
postgresql 使ってるのか。
Hyper Estraier でいいと思うけどなあ。ずっと楽だし
Hyper Estraier でいいと思うけどなあ。ずっと楽だし
211login:Penguin
2012/08/12(日) 05:00:25.96ID:9d6phxtS212login:Penguin
2012/12/14(金) 05:08:44.92ID:/WE9Cz8v Fessというソフトなんですけど、
検索されたファイルの名前に、スペースが含まれている場合に、
一覧から開くことができません。
対策ってありますでしょうか。
検索されたファイルの名前に、スペースが含まれている場合に、
一覧から開くことができません。
対策ってありますでしょうか。
2012/12/14(金) 11:36:00.22ID:ZBNKtAHu
>>212
FessのMLがあるからそっちで聞けば?
FessのMLがあるからそっちで聞けば?
214login:Penguin
2013/01/12(土) 01:36:56.87ID:17wiELXf 聞こう聞こうと思っているうちに、
どなたかがメーリングリストで質問してくださっていました。
今、その回答町です。
どなたかがメーリングリストで質問してくださっていました。
今、その回答町です。
2013/01/27(日) 16:23:24.30ID:Y1uylGbU
全裸変換ソフトって読んでしまった。
寝てくるノシ
寝てくるノシ
■ このスレッドは過去ログ倉庫に格納されています
ニュース
- 第2次大戦に触れトランプ氏「米中は同盟国」、当時は中華民国…「抗日」巡る中国の言説補強する恐れ ★5 [蚤の市★]
- パナソニックが市販カーナビ生産終了へ 30年以上の歴史に幕、スマホナビの普及など受け [少考さん★]
- 【速報】timelesz猪俣周杜メンバー釈放 [Ailuropoda melanoleuca★]
- 【速報】 高市首相 「円の過小評価は問題だ」 ★3 [お断り★]
- 胸が大きすぎると話題のYouTuber「ヘラヘラ三銃士」まりな PRP豊胸も明かす [muffin★]
- 【東京】ウズベキスタン国籍のフードデリバリー配達員を逮捕 配達先の女子小学生にキスや体を触るなどわいせつ行為か ★2 [煮卵★]
- 愛国保守「世界中が日本を支援し中国が核ミサイルを使わずドローンの飽和攻撃もしなければ勝てる」 これ本気で言ってるの? [819729701]
- 【急募】インフレ、物価高で慣れたもの、外食ランチ1000円超え、牛乳1L250円前後etc [943688309]
- 【速報】日本政府 「トランプの同盟国発言は昔話を持ち出しているだけ。アメリカは台湾問題で譲歩はしないと確信している」 [931948549]
- 【高市🦎値上げ】やっぱりザ・ビッグが一番安いよ🟧オーナーズカードと株主優待券の併用が強すぎるのよ [457294144]
- お前らやる気が起きない時って何してる?
- 高市早苗さんの新作奇行動画が発見される [469534301]