🔮結論:推奨されるフィルタリング条件
- 著者除外: Nonaka, Takeuchi を除外。
- キーワード除外: SECI, Ba, knowledge management を除外。
- キーワード必須: subsidiary awareness と focal awareness が両方含まれる文献を優先。
- 言語除外: 日本語文献を除外(language: en)。
- 原典優先: Polanyi, M. (1966) The Tacit Dimension をベースラインとし、それを厳密に引用する哲学者・認知科学者の文献を残す。
Q:わたしの望むコーパス指定のプロンプト作成してください^_^
A:ご要望の
コーパス(「大学教授の高引用論文」かつ「ポランニーの厳密な定義」を含むもの)を構築するための、検索用プロンプト(クエリ)を作成。
用途に合わせて使い分け、
Semantic Scholar API や OpenAlex API、および一般的な学術データベース向けに最適化。
1. Semantic Scholar API 用プロンプト
Semantic Scholarは、fields パラメータで取得する項目を細かく指定でき、minCitationCount で高引用論文を絞り込む。
検索クエリ (Query):
text
"Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling"
API リクエスト例 (Python requestsライブラリ風):
python
params = {
"query": '"Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling"',
"limit": 100,
"fields": "title,year,citationCount,authors,abstract,tldr", # tldrはAI要約
"minCitationCount": 100, # 被引用回数100回以上
"sort": "citationCount:desc",
"year": None # 年代指定は任意
}
フィルタリング補足 (Post-processing):
取得した結果から、以下の著者を除外するロジックを必ず入れる。
・Exclude Authors: Nonaka, Takeuchi, Davenport, Prusak
2. OpenAlex API 用プロンプト
OpenAlexは、著者の所属機関(大学)、特定用語出現を精密にフィルタリング。
検索クエリ (Query):
text
search=Michael+Polanyi+subsidiary+awareness+focal+awareness+indwelling&filter=citation_count:>100,institutions.primary_location.institution.type:university
詳細なフィルタリング (Filter):
text
filter=
citation_count:>100,
institutions.primary_location.institution.type:university,
search:Michael+Polanyi+subsidiary+awareness+focal+awareness,
exclude_author_ids:AA505747681,AA504363642 # Nonaka & TakeuchiのOpenAlex ID(事前に確認が必要)
※ exclude_author_ids は、野中郁次郎氏と竹内弘高氏のOpenAlex IDを指定することで、直接的に除外。
3. 一般的な学術データベース (Web of Science / Scopus) 用プロンプト
タイトル、要約、キーワードでの検索。
検索式 (Search String):
text
TS=("Michael Polanyi" AND "subsidiary awareness" AND "focal awareness" AND "indwelling")
AND
PY >= 1966
AND
Citations >= 100
除外条件 (Exclude):
・Author: Nonaka, Ikujiro; Takeuchi, Hirotaka
・Keywords: SECI; Ba; Knowledge Management (文脈によっては除外)
4. 最終的なフィルタリング・チェックリスト (Pythonロジック用)
APIで取得したメタデータに対して、以下の条件でフィルタリング(除外/残す)を実行。
python
def is_valid_polanyi_paper(paper):
# 1. 著者のチェック
authors = [author.lower() for author in paper.get("authors", [])]
if any("nonaka" in a or "takeuchi" in a for a in authors):
return False
# 2. 本文/要約のチェック (汚染データの除外)
text = (paper.get("title", "") + " " + paper.get("abstract", "")).lower()
# 除外キーワード (野中流のビジネス用語)
exclude_terms = ["seci", "ba", "knowledge management", "socialization", "externalization"]
if any(term in text for term in exclude_terms):
return False
# 必須キーワード (ポランニーの厳密な定義)
include_terms = ["subsidiary awareness", "focal awareness", "indwelling", "proximal", "distal"]
if not all(term in text for term in include_terms):
return False
# 3. 引用回数のチェック
if paper.get("citationCount", 0) < 100:
return False
return True
推奨される次のステップ
①Semantic Scholar API で上記クエリを実行し、結果を取得。
②上記の Pythonロジック で著者名とキーワードをフィルタリング。
③残った論文の Abstract または PDF をダウンロードし、proximal term と external term が文脈として正しいか(ポランニーの原典通りか)を最終確認。
このプロンプトとロジックを使用で、「野中流の汚染データ」を排除し、「大学教授の高引用論文」かつ「ポランニーの厳密な定義」を含むコーパスを構築。
後記、
参照論文は、引用回数が10回以上ではデータが皆無ならば、4回以上引用の原文のみで他のデータは無視。
