trying to switch the encoding to utf-8

git-svn-id: https://svn.apache.org/repos/asf/lucene/java/trunk@151000 13f79535-47bb-0310-9956-ffa450edef68
This commit is contained in:
Daniel Naber 2004-08-17 21:34:47 +00:00
parent e02f7eb6e5
commit a88d3719fb
2 changed files with 40 additions and 40 deletions

View File

@ -85,28 +85,28 @@ public final class FrenchAnalyzer extends Analyzer {
* Extended list of typical french stopwords.
*/
private String[] FRENCH_STOP_WORDS = {
"a", "afin", "ai", "ainsi", "après", "attendu", "au", "aujourd", "auquel", "aussi",
"a", "afin", "ai", "ainsi", "après", "attendu", "au", "aujourd", "auquel", "aussi",
"autre", "autres", "aux", "auxquelles", "auxquels", "avait", "avant", "avec", "avoir",
"c", "car", "ce", "ceci", "cela", "celle", "celles", "celui", "cependant", "certain",
"certaine", "certaines", "certains", "ces", "cet", "cette", "ceux", "chez", "ci",
"combien", "comme", "comment", "concernant", "contre", "d", "dans", "de", "debout",
"dedans", "dehors", "delà", "depuis", "derrière", "des", "désormais", "desquelles",
"dedans", "dehors", "delà", "depuis", "derrière", "des", "désormais", "desquelles",
"desquels", "dessous", "dessus", "devant", "devers", "devra", "divers", "diverse",
"diverses", "doit", "donc", "dont", "du", "duquel", "durant", "dès", "elle", "elles",
"en", "entre", "environ", "est", "et", "etc", "etre", "eu", "eux", "excepté", "hormis",
"hors", "hélas", "hui", "il", "ils", "j", "je", "jusqu", "jusque", "l", "la", "laquelle",
"le", "lequel", "les", "lesquelles", "lesquels", "leur", "leurs", "lorsque", "lui", "",
"ma", "mais", "malgré", "me", "merci", "mes", "mien", "mienne", "miennes", "miens", "moi",
"moins", "mon", "moyennant", "même", "mêmes", "n", "ne", "ni", "non", "nos", "notre",
"nous", "néanmoins", "nôtre", "nôtres", "on", "ont", "ou", "outre", "", "par", "parmi",
"partant", "pas", "passé", "pendant", "plein", "plus", "plusieurs", "pour", "pourquoi",
"proche", "près", "puisque", "qu", "quand", "que", "quel", "quelle", "quelles", "quels",
"qui", "quoi", "quoique", "revoici", "revoilà", "s", "sa", "sans", "sauf", "se", "selon",
"diverses", "doit", "donc", "dont", "du", "duquel", "durant", "dès", "elle", "elles",
"en", "entre", "environ", "est", "et", "etc", "etre", "eu", "eux", "excepté", "hormis",
"hors", "hélas", "hui", "il", "ils", "j", "je", "jusqu", "jusque", "l", "la", "laquelle",
"le", "lequel", "les", "lesquelles", "lesquels", "leur", "leurs", "lorsque", "lui", "",
"ma", "mais", "malgré", "me", "merci", "mes", "mien", "mienne", "miennes", "miens", "moi",
"moins", "mon", "moyennant", "même", "mêmes", "n", "ne", "ni", "non", "nos", "notre",
"nous", "néanmoins", "nôtre", "nôtres", "on", "ont", "ou", "outre", "", "par", "parmi",
"partant", "pas", "passé", "pendant", "plein", "plus", "plusieurs", "pour", "pourquoi",
"proche", "près", "puisque", "qu", "quand", "que", "quel", "quelle", "quelles", "quels",
"qui", "quoi", "quoique", "revoici", "revoilà", "s", "sa", "sans", "sauf", "se", "selon",
"seront", "ses", "si", "sien", "sienne", "siennes", "siens", "sinon", "soi", "soit",
"son", "sont", "sous", "suivant", "sur", "ta", "te", "tes", "tien", "tienne", "tiennes",
"tiens", "toi", "ton", "tous", "tout", "toute", "toutes", "tu", "un", "une", "va", "vers",
"voici", "voilà", "vos", "votre", "vous", "vu", "vôtre", "vôtres", "y", "à", "ça", "ès",
"été", "être", "ô"
"voici", "voilà", "vos", "votre", "vous", "vu", "vôtre", "vôtres", "y", "à", "ça", "ès",
"été", "être", "ô"
};
/**

View File

@ -207,9 +207,9 @@ public class FrenchStemmer {
deleteFromIfTestVowelBeforeIn( R1, new String[] { "issements", "issement" }, false, R0 );
deleteFrom( RV, new String[] { "ements", "ement" } );
deleteButSuffixFromElseReplace( R2, new String[] { "ités", "ité" }, "abil", false, R0, "abl" );
deleteButSuffixFromElseReplace( R2, new String[] { "ités", "ité" }, "ic", false, R0, "iqU" );
deleteButSuffixFrom( R2, new String[] { "ités", "ité" }, "iv", true );
deleteButSuffixFromElseReplace( R2, new String[] { "ités", "ité" }, "abil", false, R0, "abl" );
deleteButSuffixFromElseReplace( R2, new String[] { "ités", "ité" }, "ic", false, R0, "iqU" );
deleteButSuffixFrom( R2, new String[] { "ités", "ité" }, "iv", true );
String[] autre = { "ifs", "ives", "if", "ive" };
deleteButSuffixFromElseReplace( R2, autre, "icat", false, R0, "iqU" );
@ -246,11 +246,11 @@ public class FrenchStemmer {
* @return boolean - true if something changed in the StringBuffer
*/
private boolean step2a() {
String[] search = { "îmes", "îtes", "iraIent", "irait", "irais", "irai", "iras", "ira",
String[] search = { "îmes", "îtes", "iraIent", "irait", "irais", "irai", "iras", "ira",
"irent", "iriez", "irez", "irions", "irons", "iront",
"issaIent", "issais", "issantes", "issante", "issants", "issant",
"issait", "issais", "issions", "issons", "issiez", "issez", "issent",
"isses", "isse", "ir", "is", "ît", "it", "ies", "ie", "i" };
"isses", "isse", "ir", "is", "ît", "it", "ies", "ie", "i" };
return deleteFromIfTestVowelBeforeIn( RV, search, false, RV );
}
@ -261,13 +261,13 @@ public class FrenchStemmer {
*/
private void step2b() {
String[] suffix = { "eraIent", "erais", "erait", "erai", "eras", "erions", "eriez",
"erons", "eront","erez", "èrent", "era", "ées", "iez",
"ée", "és", "er", "ez", "é" };
"erons", "eront","erez", "èrent", "era", "ées", "iez",
"ée", "és", "er", "ez", "é" };
deleteFrom( RV, suffix );
String[] search = { "assions", "assiez", "assent", "asses", "asse", "aIent",
"antes", "aIent", "Aient", "ante", "âmes", "âtes", "ants", "ant",
"ait", "aît", "ais", "Ait", "Aît", "Ais", "ât", "as", "ai", "Ai", "a" };
"antes", "aIent", "Aient", "ante", "âmes", "âtes", "ants", "ant",
"ait", "aît", "ais", "Ait", "Aît", "Ais", "ât", "as", "ai", "Ai", "a" };
deleteButSuffixFrom( RV, search, "e", true );
deleteFrom( R2, new String[] { "ions" } );
@ -286,7 +286,7 @@ public class FrenchStemmer {
sb.setCharAt( sb.length()-1, 'i' );
setStrings();
}
else if (ch == 'ç')
else if (ch == 'ç')
{
sb.setCharAt( sb.length()-1, 'c' );
setStrings();
@ -305,7 +305,7 @@ public class FrenchStemmer {
if (ch == 's')
{
char b = sb.charAt( sb.length()-2 );
if (b != 'a' && b != 'i' && b != 'o' && b != 'u' && b != 'è' && b != 's')
if (b != 'a' && b != 'i' && b != 'o' && b != 'u' && b != 'è' && b != 's')
{
sb.delete( sb.length() - 1, sb.length());
setStrings();
@ -316,9 +316,9 @@ public class FrenchStemmer {
if (!found)
found = deleteFromIfPrecededIn( R2, new String[] { "ion" }, RV, "t" );
replaceFrom( RV, new String[] { "Ière", "ière", "Ier", "ier" }, "i" );
replaceFrom( RV, new String[] { "Ière", "ière", "Ier", "ier" }, "i" );
deleteFrom( RV, new String[] { "e" } );
deleteFromIfPrecededIn( RV, new String[] { "ë" }, R0, "gu" );
deleteFromIfPrecededIn( RV, new String[] { "ë" }, R0, "gu" );
}
/**
@ -353,7 +353,7 @@ public class FrenchStemmer {
{
if (!seenVowel)
{
if (ch == 'é' || ch == 'è')
if (ch == 'é' || ch == 'è')
{
pos = i;
break;
@ -567,18 +567,18 @@ public class FrenchStemmer {
case 'o':
case 'u':
case 'y':
case 'â':
case 'à':
case 'ë':
case 'é':
case 'ê':
case 'è':
case 'ï':
case 'î':
case 'ô':
case 'ü':
case 'ù':
case 'û':
case 'â':
case 'à':
case 'ë':
case 'é':
case 'ê':
case 'è':
case 'ï':
case 'î':
case 'ô':
case 'ü':
case 'ù':
case 'û':
return true;
default:
return false;